julián medina

Агенты

Как оценить агента ИИ, прежде чем включать его в свою работу

Хулиан Медина · Директор SourcingUp и создатель CommerceUp

Перед запуском протестируйте его с помощью репрезентативных задач и определенных критериев приемки. Я включил неполную информацию, инструменты, которые не работают, и ситуации, требующие консультации человека.

Соберите комплект дел

Я собрал типичные примеры, известные исключения и запросы, выходящие за рамки области применения. Для каждого случая я записал, какой результат будет приемлемым, а каких действий предпринимать не следует. Это позволяет сравнивать изменения вне зависимости от впечатления, оставшегося от последнего теста. Также сохраните используемые данные и настройки.

Я измерил остаточную работу

Подсчитайте задания, выполненные правильно, ошибки, вмешательства и исправления. Агент может выполнить слишком много задач и оставить команде слишком много усилий по проверке. В примере классификации запросов важно как правильно определить категорию, так и признать, что неоднозначное сообщение требует пересмотра.

Попробую еще раз, когда система изменится

Новая модель, инструкция или интеграция могут изменить поведение. Я повторил соответствующие случаи и добавил неисправности, обнаруженные в эксплуатации. Таким образом, оценка становится способом сохранить обучение. Цель — узнать, где вы можете работать, а где вам нужна поддержка, а не показать, что вы никогда не терпите неудач.

Чтобы применить это на практике

Откуда этот взгляд?

Гид Хулиана Медины. Предлагаемые сценарии носят иллюстративный характер; Они не представляют собой измеренные результаты для клиентов. Моя работа в SourcingUp.