エージェント
AI エージェントを業務に組み込む前に評価する方法
Julián Medina 著 · SourcingUp ディレクター、CommerceUp 作成者
実行する前に、代表的なタスクと定義された許容基準を使用してテストします。不完全な情報、失敗するツール、人に相談する必要がある状況も含めました。
ケースをまとめてみる
一般的な例、既知の例外、および範囲外のリクエストを集めました。ケースごとに、どのような結果が許容されるのか、どのようなアクションが発生すべきではないのかを書き留めました。これにより、前回のテストで残された印象に依存せずに変更を比較することができます。使用したデータや設定も保管してください。
残仕事量を計測してみました
正しく完了したタスク、エラー、介入、修正を数えます。エージェントが完了するタスクが多すぎると、チームに多大なレビュー作業が残される可能性があります。クエリ分類の例では、カテゴリを正しく理解することと、あいまいなメッセージには修正が必要であることを認識することが重要です。
システムが変わったらまた挑戦してみます
新しいモデル、命令、または統合によって動作が変わる可能性があります。関連する事例を繰り返し、運用中に見つかった失敗を追加しました。したがって、評価は学習を維持する方法になります。目標は、自分がどこで働けるか、どこでサポートが必要かを知ることであり、決して失敗しないことを示すことではありません。
それを実践するには
- ケースごとに期待される結果を定義しました。
- ツールのエラーやデータの欠落も含めました。
- 介入と再作業を記録します。
- 関連する変更を加えた後、評価を繰り返しました。
この見た目はどこから来たのでしょうか?
ガイドはJulián Medina。提案されたシナリオは例示的なものです。これらは顧客の測定結果を表すものではありません。 ソーシングアップでの私の仕事。