AI Operations · Rol
AI Evaluation Engineer
El AI Evaluation Engineer decide si un sistema de IA es lo bastante bueno para producción. Diseña las evals, mide calidad de forma objetiva y bloquea lo que no pasa el listón.
Qué hace
- Construir conjuntos de evaluación y métricas de calidad por caso de uso.
- Montar evals automáticas en el pipeline (gate antes de desplegar).
- Detectar regresiones de calidad y alucinaciones antes que el usuario.
Skills que pide
Salario por país y seniority
| País | Seniority | P25 | Mediana | P75 | |
|---|---|---|---|---|---|
| Estados Unidos | Todas | €117.040 | €117.040 | €117.040 | Estimación de fuentes públicas |
Cifras en euros, bruto anual — cada una con su fuente.
Calcular un salarioTambién llamado
El mercado usa varios títulos para el mismo rol:
Cómo cambia por seniority
- Junior — Construye conjuntos de evaluación y ejecuta evals bajo diseño dado.
- Mid — Monta evals automáticas como gate en el pipeline y define métricas por caso.
- Senior — Diseña la estrategia de evaluación y detecta regresiones antes que el usuario.
Cuándo contratarlo
Cuando 'parece que funciona' ya no basta y necesitas medir la calidad para poder fiarte.
Cuándo no
Si el volumen es bajo y una revisión manual puntual todavía te cubre.
Preguntas de entrevista
1. Tienes que decidir si una versión nueva de un agente es mejor que la actual. ¿Cómo lo montas?
Qué buscar: Construye un conjunto de evaluación con casos reales y umbral; mide, no opina.
2. ¿Cuántos casos necesita un buen eval y cómo los eliges?
Qué buscar: Representatividad sobre cantidad; empieza con casos bien elegidos y crece con los fallos de producción.
3. ¿Cómo distingues errores tolerables de errores que no pueden pasar nunca?
Qué buscar: Separa la media de los casos críticos y bloquea estos aunque la media sea buena.
4. ¿Cómo evalúas algo subjetivo, como la calidad de un texto generado?
Qué buscar: Usa rúbricas, evaluadores múltiples o LLM-as-judge con criterio, no solo "me suena bien".
Scorecard
- Diseño de evals — Construye conjuntos con casos reales, salida esperada y umbral de apto.
- Representatividad — Cubre la variedad real del proceso; crece con los fallos de producción.
- Criticidad — Distingue errores tolerables de los que no pueden pasar y bloquea estos.
- Evaluar lo subjetivo — Aplica rúbricas o jueces con criterio para calidad no binaria.
Banderas rojas
- — Evalúa "a ojo" leyendo unas pocas salidas.
- — Un eval de juguete con cuatro casos que no representan producción.
- — Mira solo la media y no los casos que no pueden fallar.
¿Contratando o evaluando este perfil?
Genera el guion de entrevista y el scorecard completos, adaptados a la seniority que buscas.
Abrir el interview scorecard