Агенты
Как оценить агента ИИ, прежде чем включать его в свою работу
Хулиан Медина · Директор SourcingUp и создатель CommerceUp
Перед запуском протестируйте его с помощью репрезентативных задач и определенных критериев приемки. Я включил неполную информацию, инструменты, которые не работают, и ситуации, требующие консультации человека.
Соберите комплект дел
Я собрал типичные примеры, известные исключения и запросы, выходящие за рамки области применения. Для каждого случая я записал, какой результат будет приемлемым, а каких действий предпринимать не следует. Это позволяет сравнивать изменения вне зависимости от впечатления, оставшегося от последнего теста. Также сохраните используемые данные и настройки.
Я измерил остаточную работу
Подсчитайте задания, выполненные правильно, ошибки, вмешательства и исправления. Агент может выполнить слишком много задач и оставить команде слишком много усилий по проверке. В примере классификации запросов важно как правильно определить категорию, так и признать, что неоднозначное сообщение требует пересмотра.
Попробую еще раз, когда система изменится
Новая модель, инструкция или интеграция могут изменить поведение. Я повторил соответствующие случаи и добавил неисправности, обнаруженные в эксплуатации. Таким образом, оценка становится способом сохранить обучение. Цель — узнать, где вы можете работать, а где вам нужна поддержка, а не показать, что вы никогда не терпите неудач.
Чтобы применить это на практике
- Я определил ожидаемые результаты для каждого случая.
- Я включил ошибки инструмента и недостающие данные.
- Запись вмешательств и доработок.
- Я повторил оценку после соответствующих изменений.
Откуда этот взгляд?
Гид Хулиана Медины. Предлагаемые сценарии носят иллюстративный характер; Они не представляют собой измеренные результаты для клиентов. Моя работа в SourcingUp.