Saltar al contenido
Implementa.
← Todo el glosario

Evaluaciones de agentes (evals)

Practica

evals · evaluacion de agentes · pruebas de agentes

Las evaluaciones de agentes (evals) son pruebas sistematicas y repetibles que miden si un agente hace bien su trabajo: precision, seguridad, coste y comportamiento ante casos dificiles. Son a un agente lo que los tests son a un software: sin ellas no sabes si un cambio lo mejoro o lo rompio.

Un eval es un conjunto de casos con respuesta esperada (o con un criterio de juicio) contra el que se corre el agente una y otra vez. Sirven para tres cosas: decidir si un agente esta listo para produccion, detectar regresiones cuando se cambia un prompt, un modelo o una herramienta, y vigilar en vivo que la calidad no se degrade. Sin evals, 'el agente va mejor' es una opinion; con evals, es un numero. Es la base sobre la que se puede dar mas autonomia con cabeza.

En qué se diferencia de

Monitorizacion
La monitorizacion observa el agente en vivo; los evals lo prueban contra casos controlados, tambien antes de produccion.

Ejemplos

  • Correr 200 conversaciones tipo con respuesta esperada cada vez que se cambia el modelo del agente es un eval.
  • Medir el porcentaje de resoluciones correctas y el coste medio por caso antes de subir un agente a produccion.

Preguntas frecuentes

Cada cuanto se corren los evals?
En cada cambio relevante (prompt, modelo, herramienta) y de forma periodica en produccion. La idea es que ningun cambio llegue al cliente sin pasar por la bateria de casos.

Términos relacionados