julián medina

代理商

在将人工智能代理纳入您的运营之前如何对其进行评估

作者: Julián Medina · SourcingUp 总监兼 CommerceUp 创始人

在运行之前,使用代表性任务和定义的验收标准对其进行测试。我包含了不完整的信息、失败的工具以及需要咨询人员的情况。

整理一组案例

我收集了常见示例、已知异常和超出范围的请求。对于每种情况,我都写下了哪些结果是可以接受的以及哪些行动不应该发生。这样可以在不依赖于上次测试留下的印象的情况下对更改进行比较。还要保留使用的数据和设置。

我测量了剩余功

计算正确完成的任务、错误、干预和纠正。代理可能会完成过多的任务,并给团队带来过多的审核工作。在查询分类的示例中,重要的是获得正确的类别并认识到不明确的消息需要修改。

当系统改变时我会再试一次

新的模型、指令或集成可以改变行为。我重复了相关案例,并补充了运行中发现的故障。因此,评估成为保存学习的一种方式。目标是了解您可以在哪里工作以及在哪里需要支持,而不是证明您永远不会失败。

将其付诸实践

这种表情从何而来?

Julián Medina (Julián Medina) 指导。提议的情景是说明性的;它们并不代表测量的客户结果。 我在 SourcingUp 的工作