julián medina

Agentes

Cómo evaluar un agente de IA antes de incorporarlo a la operación

Por Julián Medina · Director de SourcingUp y creador de CommerceUp

Probalo con tareas representativas y criterios de aceptación definidos antes de ejecutarlo. Incluí información incompleta, herramientas que fallan y situaciones que requieren consultar a una persona.

Armá un conjunto de casos

Reuní ejemplos habituales, excepciones conocidas y pedidos fuera de alcance. Para cada caso, escribí qué resultado sería aceptable y qué acción no debería ocurrir. Esto permite comparar cambios sin depender de la impresión que deja la última prueba. Conservá también los datos y la configuración usados.

Medí el trabajo residual

Contá tareas completadas correctamente, errores, intervenciones y correcciones. Un agente puede terminar muchas tareas y dejar al equipo un esfuerzo de revisión demasiado alto. En un ejemplo de clasificación de consultas, importa tanto acertar la categoría como reconocer que un mensaje ambiguo requiere revisión.

Volvé a probar cuando cambie el sistema

Un modelo, una instrucción o una integración nuevos pueden cambiar el comportamiento. Repetí los casos relevantes y agregá los fallos encontrados en operación. La evaluación se convierte así en una forma de conservar aprendizaje. El objetivo es saber dónde puede trabajar y dónde necesita apoyo, no demostrar que nunca falla.

Para llevarlo a la práctica

De dónde sale esta mirada

Guía de Julián Medina. Los escenarios propuestos son ilustrativos; no representan resultados medidos de clientes. Mi trabajo en SourcingUp.