Agentes
Cómo evaluar un agente de IA antes de incorporarlo a la operación
Por Julián Medina · Director de SourcingUp y creador de CommerceUp
Probalo con tareas representativas y criterios de aceptación definidos antes de ejecutarlo. Incluí información incompleta, herramientas que fallan y situaciones que requieren consultar a una persona.
Armá un conjunto de casos
Reuní ejemplos habituales, excepciones conocidas y pedidos fuera de alcance. Para cada caso, escribí qué resultado sería aceptable y qué acción no debería ocurrir. Esto permite comparar cambios sin depender de la impresión que deja la última prueba. Conservá también los datos y la configuración usados.
Medí el trabajo residual
Contá tareas completadas correctamente, errores, intervenciones y correcciones. Un agente puede terminar muchas tareas y dejar al equipo un esfuerzo de revisión demasiado alto. En un ejemplo de clasificación de consultas, importa tanto acertar la categoría como reconocer que un mensaje ambiguo requiere revisión.
Volvé a probar cuando cambie el sistema
Un modelo, una instrucción o una integración nuevos pueden cambiar el comportamiento. Repetí los casos relevantes y agregá los fallos encontrados en operación. La evaluación se convierte así en una forma de conservar aprendizaje. El objetivo es saber dónde puede trabajar y dónde necesita apoyo, no demostrar que nunca falla.
Para llevarlo a la práctica
- Definí resultados esperados por caso.
- Incluí errores de herramientas y datos ausentes.
- Registrá intervenciones y retrabajo.
- Repetí la evaluación después de cambios relevantes.
De dónde sale esta mirada
Guía de Julián Medina. Los escenarios propuestos son ilustrativos; no representan resultados medidos de clientes. Mi trabajo en SourcingUp.