AI Operations · Rol
AI Reliability Engineer (LLMOps)
El AI Reliability Engineer (LLMOps) mantiene los sistemas de IA en pie: monitoriza, controla coste y latencia, y responde cuando un agente falla o se desvía. Es el SRE de la capa de IA.
Qué hace
- Instrumentar observabilidad de agentes: coste, latencia, errores y calidad.
- Definir alertas, fallbacks y límites de gasto por agente.
- Diagnosticar incidencias de producción y prevenir regresiones.
Skills que pide
Salario por país y seniority
| País | Seniority | P25 | Mediana | P75 | |
|---|---|---|---|---|---|
| Alemania | Todas | €73.000 | €73.000 | €73.000 | Estimación de fuentes públicas |
| España | Todas | €70.000 | €70.000 | €70.000 | Estimación de fuentes públicas |
| Francia | Todas | €61.225 | €75.300 | €80.350 | Estimación de fuentes públicas |
| Italia | Todas | €46.033 | €46.033 | €46.033 | Estimación de fuentes públicas |
| Estados Unidos | Mid | €114.927 | €114.927 | €114.927 | Estimación de fuentes públicas |
| Estados Unidos | Senior | €142.042 | €142.042 | €142.042 | Estimación de fuentes públicas |
| Estados Unidos | Todas | €142.042 | €142.042 | €142.042 | Estimación de fuentes públicas |
Cifras en euros, bruto anual — cada una con su fuente.
Calcular un salarioTambién llamado
El mercado usa varios títulos para el mismo rol:
Cómo cambia por seniority
- Junior — Instrumenta logs y paneles y atiende alertas bajo runbook.
- Mid — Define alertas, fallbacks y límites de gasto por agente; diagnostica incidencias.
- Senior — Responde de la fiabilidad de la flota de agentes y previene regresiones a escala.
Cuándo contratarlo
Cuando tienes varios agentes en producción y su coste o su fiabilidad se te escapan.
Cuándo no
Si aún tienes un solo piloto sin tráfico real: todavía no hay nada que fiabilizar.
Preguntas de entrevista
1. Un agente en producción degrada su calidad sin que nadie tocara el código. ¿Cómo lo diagnosticas?
Qué buscar: Piensa en deriva (modelo del proveedor, datos de entrada), no solo en bugs; usa observabilidad.
2. ¿Qué instrumentas en un sistema LLM para poder operarlo con confianza?
Qué buscar: Traza entradas/pasos/coste/latencia y alerta sobre lo anormal; paneles para el dueño, no solo logs.
3. El proveedor va a retirar el modelo que usas. ¿Cuál es tu plan?
Qué buscar: Vuelve a pasar evals con el modelo nuevo, versiona y prepara rollback; no confía en "irá igual".
4. ¿Cómo pones SLAs a algo probabilístico como un LLM?
Qué buscar: Define objetivos por tasa de acierto/latencia/coste y escala a humano cuando se salen.
Scorecard
- Detección de deriva — Distingue fallo de código de cambio del mundo; detecta degradación a tiempo.
- Observabilidad de LLM — Instrumenta entradas, pasos, coste y latencia; alerta útil, no ruido.
- Gestión de cambios de modelo — Versiona, re-evalúa y prepara rollback ante deprecaciones del proveedor.
- Fiabilidad operable — Define objetivos medibles y rutas de escalado para algo probabilístico.
Banderas rojas
- — Solo loguea la salida final: cuando falla, no hay forma de saber por qué.
- — Cambia de modelo sin volver a pasar los evals.
- — Alerta de todo hasta que nadie hace caso a las alertas.
¿Contratando o evaluando este perfil?
Genera el guion de entrevista y el scorecard completos, adaptados a la seniority que buscas.
Abrir el interview scorecard