Evaluación (evals)
Fase: ConstruirMedir si la IA acierta, con casos reales y un umbral, antes y después de producción.
La evaluación es la capacidad de decir, con números, si un agente hace bien su trabajo. Se construye un conjunto de casos con la respuesta correcta y se mide contra él en cada cambio. Sin evals no hay forma de saber si una versión nueva mejora o empeora.
Qué incluye
- Construir un conjunto de evaluación con casos reales y la salida esperada.
- Definir el umbral de "apto": qué nivel de acierto se exige para entregar.
- Automatizar la evaluación en cada cambio de prompt, modelo o herramienta.
- Distinguir errores tolerables de errores que no pueden pasar (y bloquear estos).
Cuándo la necesitas
- Cambias un prompt y no sabes si mejoró o rompió otra cosa.
- La calidad depende de que alguien "eche un ojo" a las salidas de vez en cuando.
- Quieres soltar al humano del loop pero no tienes forma de confiar en la salida.
Cómo se mide
- Tasa de acierto contra el conjunto de evaluación.
- Cobertura del eval: porcentaje de casos reales representados.
- Regresiones detectadas antes de producción vs. incidencias en cliente.
Errores comunes
- Evaluar "a ojo" leyendo unas cuantas salidas: no escala y no detecta regresiones.
- Un eval con cuatro casos de juguete que no representan lo que pasa en producción.
- Medir solo la media y no los casos que no pueden fallar nunca.
Preguntas frecuentes
- ¿Cuántos casos necesita un buen eval?
- Los suficientes para representar la variedad real del proceso, no un número mágico. Es mejor empezar con 20-30 casos bien elegidos que con cientos genéricos, e ir ampliando con los fallos que aparecen en producción.
- ¿La evaluación es un proyecto o algo continuo?
- Continuo. El eval se corre en cada cambio y crece con cada incidencia. Es la red que permite iterar rápido sin romper lo que ya funciona.
Capacidades relacionadas
Señales recientes
Tendencias, prácticas, herramientas, casos y datos de mercado para esta capacidad, con fuente. Se amplía cada semana.
Tendencias
La frontera irregular: modelos con oro en la Olimpiada Internacional de Matemáticas que solo leen bien un reloj analógico el 50,1% de las veces
Stanford HAI usa Gemini Deep Think —medalla de oro en la IMO— frente a un dato incómodo: el mejor modelo lee correctamente relojes analógicos solo el 50,1% de las veces. Es lo que el informe llama la frontera irregular de la IA. Consecuencia directa para evaluación: el rendimiento en un benchmark no transfiere a la tarea contigua, y ningún resultado agregado sustituye a una batería de evaluación construida sobre las tareas concretas del proceso que vas a operar.
Stanford HAI — AI Index 2026 · 2026-04-14 · E2Prácticas
Las buenas prácticas de evaluación 2026 combinan eval automática y humana en continuo
Las buenas prácticas de evaluación de LLM en 2026 son: usar datasets representativos, combinar métodos automáticos y humanos, evaluar de forma continua y revisar los fallos con regularidad. El foco pasa de la precisión de benchmark a la evaluación holística (calidad conversacional, exactitud de contenido, métricas RAG y seguridad/compliance).
Future AGI (Medium) · 2026-06-01 · E3Datos
Los agentes pasan del 12% al ~66% de tareas resueltas en OSWorld, pero siguen fallando aproximadamente 1 de cada 3 intentos
El AI Index 2026 de Stanford HAI recoge el salto de los agentes en OSWorld, el benchmark de tareas reales de ordenador en distintos sistemas operativos: del 12% al ~66% de éxito. La segunda mitad del dato es la que manda en producción: siguen fallando en torno a uno de cada tres intentos en benchmarks estructurados. Para evaluación de IA significa que la pregunta útil no es si el agente puede hacer la tarea, sino qué pasa en el tercio en el que no la hace.
Stanford HAI — AI Index 2026 · 2026-04-14 · E2Los benchmarks de accuracy no bastan para la IA agéntica empresarial: hace falta un marco multidimensional
Un paper académico propone un marco multidimensional para evaluar sistemas de IA agéntica empresarial más allá de la accuracy: coste, fiabilidad, seguridad y restricciones operativas. Documenta la brecha entre el rendimiento en benchmark y el éxito en producción, donde los benchmarks existentes optimizan la finalización de tareas pero no las restricciones reales de la empresa.
arXiv — Beyond Accuracy: Evaluating Enterprise Agentic AI · 2025-11-01 · E2¿Te falta cubrir alguna de estas?
Empieza por un assessment: qué capacidades tienes, cuáles te faltan y por dónde da más retorno empezar.
Hablar con nosotros →