代理商
在将人工智能代理纳入您的运营之前如何对其进行评估
作者: Julián Medina · SourcingUp 总监兼 CommerceUp 创始人
在运行之前,使用代表性任务和定义的验收标准对其进行测试。我包含了不完整的信息、失败的工具以及需要咨询人员的情况。
整理一组案例
我收集了常见示例、已知异常和超出范围的请求。对于每种情况,我都写下了哪些结果是可以接受的以及哪些行动不应该发生。这样可以在不依赖于上次测试留下的印象的情况下对更改进行比较。还要保留使用的数据和设置。
我测量了剩余功
计算正确完成的任务、错误、干预和纠正。代理可能会完成过多的任务,并给团队带来过多的审核工作。在查询分类的示例中,重要的是获得正确的类别并认识到不明确的消息需要修改。
当系统改变时我会再试一次
新的模型、指令或集成可以改变行为。我重复了相关案例,并补充了运行中发现的故障。因此,评估成为保存学习的一种方式。目标是了解您可以在哪里工作以及在哪里需要支持,而不是证明您永远不会失败。
将其付诸实践
- 我定义了每个案例的预期结果。
- 我包括了工具错误和丢失的数据。
- 记录干预和返工。
- 相关修改后我又重新进行了评估。
这种表情从何而来?
Julián Medina (Julián Medina) 指导。提议的情景是说明性的;它们并不代表测量的客户结果。 我在 SourcingUp 的工作。