Observabilidad
Fase: OperarVer qué hace la IA en producción: cada ejecución, su coste y por qué falló.
La observabilidad es poder mirar dentro de la IA en producción: qué entró, qué decidió, qué herramientas usó, cuánto costó y dónde se equivocó. Es la diferencia entre operar un sistema y rezar para que funcione.
Qué incluye
- Registrar cada ejecución: entrada, pasos, salida, coste y latencia.
- Trazar las decisiones del agente para poder reconstruir por qué hizo lo que hizo.
- Alertas cuando algo se sale de lo normal (coste, errores, latencia).
- Paneles por proceso y por agente para el dueño operativo, no solo para ingeniería.
Cuándo la necesitas
- Un agente falló en cliente y no puedes reconstruir qué pasó.
- El coste de la IA sube y nadie sabe qué proceso lo está disparando.
- Te enteras de los problemas por el cliente, no por tus paneles.
Cómo se mide
- Tiempo hasta detectar un incidente (cuánto tarda en saltar la alarma).
- Porcentaje de ejecuciones trazables end-to-end.
- Coste por proceso visible en tiempo casi real.
Errores comunes
- Loguear solo la salida final y no los pasos: cuando falla, no hay forma de saber por qué.
- Paneles que solo entiende ingeniería mientras el dueño del proceso va a ciegas.
- Alertar de todo hasta que nadie hace caso a ninguna alerta.
Preguntas frecuentes
- ¿Observabilidad y evaluación no son lo mismo?
- No. La evaluación mide la calidad contra casos conocidos, normalmente antes de entregar. La observabilidad mira lo que pasa en producción con tráfico real. Se necesitan las dos: una previene y la otra detecta.
- ¿Cuándo se monta la observabilidad?
- Antes de escalar. Un piloto puede vivir sin ella; una función con varios agentes en producción sin observabilidad es una función que no controlas.
Capacidades relacionadas
Señales recientes
Tendencias, prácticas, herramientas, casos y datos de mercado para esta capacidad, con fuente. Se amplía cada semana.
Tendencias
El Hype Cycle de IA agéntica de Gartner incorpora perfiles propios de gobierno, seguridad y coste junto a las tecnologías núcleo
En su Hype Cycle dedicado a la IA agéntica, Gartner mapea decenas de innovaciones a lo largo del desarrollo de agentes, integración, interacción con humanos, gestión y casos de uso. La señal relevante para la observabilidad es que junto a las tecnologías agénticas núcleo emergen perfiles propios centrados en gobierno, seguridad y coste (incluido FinOps para IA agéntica), y que el analista nombra el "agent-washing" como problema explícito de mercado, señalando las brechas de seguridad, gobierno y competencias como los frenos a la adopción en producción.
Gartner · 2026-04-02 · E3La observabilidad de agentes se consolida como categoría con un shortlist claro en 2026
El shortlist práctico de observabilidad de agentes en 2026 lo forman Arize AX/Phoenix, LangSmith, Langfuse, Braintrust, Datadog y Opik. LangSmith encaja con equipos LangGraph/LangChain (traza modelos, herramientas, recuperación y pasos del agente); Arize destaca por trazado agnóstico y evaluación integrada. La categoría deja de ser experimental.
Latitude — Best AI Agent Observability Tools 2026 · 2026-06-01 · E3Prácticas
Por defecto la telemetría GenAI de OpenTelemetry no captura prompts ni argumentos de herramientas: el contenido es opt-in por riesgo de datos sensibles
Las convenciones GenAI de OpenTelemetry incluyen solo metadatos por defecto —nombre del modelo, recuento de tokens, duraciones— porque el contenido de prompts y argumentos de herramientas puede contener datos sensibles. Activar la captura de contenido puebla los atributos de span con mensajes completos, prompts de sistema, esquemas de herramientas, argumentos y resultados. Es una decisión de gobernanza además de técnica: la traza que sirve para depurar un agente es también la traza que guarda datos de cliente.
OpenTelemetry · 2026-05-14 · E2Herramientas
El mercado de observabilidad de agentes en 2026: Braintrust, LangSmith, Arize Phoenix, Helicone, Galileo, Datadog LLM Observability y AgentOps
Guía de MLflow sobre observabilidad de agentes: la disciplina cubre cuatro pilares —monitorización, trazado, evaluación y gobierno— y las plataformas se reparten a lo largo del espectro que va de la recogida de telemetría al control con gobierno primero (LangSmith destaca en trazas y evaluación con integración profunda de LangChain). La pieza técnica que hace comparables las trazas entre frameworks es la especificación GenAI de OpenTelemetry: un esquema compartido permite ingerir en el mismo backend trazas de distintos frameworks sin parseo a medida.
MLflow · 2026-06-11 · E3Los asistentes de código ya emiten telemetría OpenTelemetry nativa: Copilot, Codex y Claude Code exportan trazas, métricas y eventos de cada interacción
Post de OpenTelemetry (James Newton-King, Microsoft) sobre observabilidad de GenAI con las convenciones semánticas del proyecto. VS Code Copilot emite trazas, métricas y eventos por cada interacción del agente; OpenAI Codex exporta eventos de log estructurados y métricas OTel de peticiones a la API, llamadas a herramientas y sesiones; Claude Code exporta métricas y eventos de log, con soporte de trazas en beta. Implicación operativa: se puede montar observabilidad de agentes sobre cualquier backend compatible con OTLP sin instrumentar a mano.
OpenTelemetry · 2026-05-14 · E2Arize Phoenix: observabilidad open-source de agentes con más de 50 métricas de calidad
Arize Phoenix es la herramienta open-source de observabilidad de agentes: trazado agnóstico de framework, monitorización en producción, experimentos y evaluaciones, con más de 50 métricas basadas en investigación (fidelidad, relevancia, seguridad, toxicidad y detección de alucinaciones). Es gratuita y de código abierto.
Arize AI · 2026-06-01 · E3¿Te falta cubrir alguna de estas?
Empieza por un assessment: qué capacidades tienes, cuáles te faltan y por dónde da más retorno empezar.
Hablar con nosotros →