Evaluaciones de agentes (evals)
Practicaevals · evaluacion de agentes · pruebas de agentes
Las evaluaciones de agentes (evals) son pruebas sistematicas y repetibles que miden si un agente hace bien su trabajo: precision, seguridad, coste y comportamiento ante casos dificiles. Son a un agente lo que los tests son a un software: sin ellas no sabes si un cambio lo mejoro o lo rompio.
Un eval es un conjunto de casos con respuesta esperada (o con un criterio de juicio) contra el que se corre el agente una y otra vez. Sirven para tres cosas: decidir si un agente esta listo para produccion, detectar regresiones cuando se cambia un prompt, un modelo o una herramienta, y vigilar en vivo que la calidad no se degrade. Sin evals, 'el agente va mejor' es una opinion; con evals, es un numero. Es la base sobre la que se puede dar mas autonomia con cabeza.
En qué se diferencia de
- Monitorizacion
- La monitorizacion observa el agente en vivo; los evals lo prueban contra casos controlados, tambien antes de produccion.
Ejemplos
- Correr 200 conversaciones tipo con respuesta esperada cada vez que se cambia el modelo del agente es un eval.
- Medir el porcentaje de resoluciones correctas y el coste medio por caso antes de subir un agente a produccion.
Preguntas frecuentes
- Cada cuanto se corren los evals?
- En cada cambio relevante (prompt, modelo, herramienta) y de forma periodica en produccion. La idea es que ningun cambio llegue al cliente sin pasar por la bateria de casos.