Saltar al contenido
Implementa.
← Todas las capacidades

Observabilidad

Fase: Operar

Ver qué hace la IA en producción: cada ejecución, su coste y por qué falló.

La observabilidad es poder mirar dentro de la IA en producción: qué entró, qué decidió, qué herramientas usó, cuánto costó y dónde se equivocó. Es la diferencia entre operar un sistema y rezar para que funcione.

Qué incluye

  • Registrar cada ejecución: entrada, pasos, salida, coste y latencia.
  • Trazar las decisiones del agente para poder reconstruir por qué hizo lo que hizo.
  • Alertas cuando algo se sale de lo normal (coste, errores, latencia).
  • Paneles por proceso y por agente para el dueño operativo, no solo para ingeniería.

Cuándo la necesitas

  • Un agente falló en cliente y no puedes reconstruir qué pasó.
  • El coste de la IA sube y nadie sabe qué proceso lo está disparando.
  • Te enteras de los problemas por el cliente, no por tus paneles.

Cómo se mide

  • Tiempo hasta detectar un incidente (cuánto tarda en saltar la alarma).
  • Porcentaje de ejecuciones trazables end-to-end.
  • Coste por proceso visible en tiempo casi real.

Errores comunes

  • Loguear solo la salida final y no los pasos: cuando falla, no hay forma de saber por qué.
  • Paneles que solo entiende ingeniería mientras el dueño del proceso va a ciegas.
  • Alertar de todo hasta que nadie hace caso a ninguna alerta.

Preguntas frecuentes

¿Observabilidad y evaluación no son lo mismo?
No. La evaluación mide la calidad contra casos conocidos, normalmente antes de entregar. La observabilidad mira lo que pasa en producción con tráfico real. Se necesitan las dos: una previene y la otra detecta.
¿Cuándo se monta la observabilidad?
Antes de escalar. Un piloto puede vivir sin ella; una función con varios agentes en producción sin observabilidad es una función que no controlas.

Capacidades relacionadas

Señales recientes

Tendencias, prácticas, herramientas, casos y datos de mercado para esta capacidad, con fuente. Se amplía cada semana.

Tendencias

El Hype Cycle de IA agéntica de Gartner incorpora perfiles propios de gobierno, seguridad y coste junto a las tecnologías núcleo

En su Hype Cycle dedicado a la IA agéntica, Gartner mapea decenas de innovaciones a lo largo del desarrollo de agentes, integración, interacción con humanos, gestión y casos de uso. La señal relevante para la observabilidad es que junto a las tecnologías agénticas núcleo emergen perfiles propios centrados en gobierno, seguridad y coste (incluido FinOps para IA agéntica), y que el analista nombra el "agent-washing" como problema explícito de mercado, señalando las brechas de seguridad, gobierno y competencias como los frenos a la adopción en producción.

Gartner · 2026-04-02 · E3

La observabilidad de agentes se consolida como categoría con un shortlist claro en 2026

El shortlist práctico de observabilidad de agentes en 2026 lo forman Arize AX/Phoenix, LangSmith, Langfuse, Braintrust, Datadog y Opik. LangSmith encaja con equipos LangGraph/LangChain (traza modelos, herramientas, recuperación y pasos del agente); Arize destaca por trazado agnóstico y evaluación integrada. La categoría deja de ser experimental.

Latitude — Best AI Agent Observability Tools 2026 · 2026-06-01 · E3

Prácticas

Por defecto la telemetría GenAI de OpenTelemetry no captura prompts ni argumentos de herramientas: el contenido es opt-in por riesgo de datos sensibles

Las convenciones GenAI de OpenTelemetry incluyen solo metadatos por defecto —nombre del modelo, recuento de tokens, duraciones— porque el contenido de prompts y argumentos de herramientas puede contener datos sensibles. Activar la captura de contenido puebla los atributos de span con mensajes completos, prompts de sistema, esquemas de herramientas, argumentos y resultados. Es una decisión de gobernanza además de técnica: la traza que sirve para depurar un agente es también la traza que guarda datos de cliente.

OpenTelemetry · 2026-05-14 · E2

Herramientas

El mercado de observabilidad de agentes en 2026: Braintrust, LangSmith, Arize Phoenix, Helicone, Galileo, Datadog LLM Observability y AgentOps

Guía de MLflow sobre observabilidad de agentes: la disciplina cubre cuatro pilares —monitorización, trazado, evaluación y gobierno— y las plataformas se reparten a lo largo del espectro que va de la recogida de telemetría al control con gobierno primero (LangSmith destaca en trazas y evaluación con integración profunda de LangChain). La pieza técnica que hace comparables las trazas entre frameworks es la especificación GenAI de OpenTelemetry: un esquema compartido permite ingerir en el mismo backend trazas de distintos frameworks sin parseo a medida.

MLflow · 2026-06-11 · E3

Los asistentes de código ya emiten telemetría OpenTelemetry nativa: Copilot, Codex y Claude Code exportan trazas, métricas y eventos de cada interacción

Post de OpenTelemetry (James Newton-King, Microsoft) sobre observabilidad de GenAI con las convenciones semánticas del proyecto. VS Code Copilot emite trazas, métricas y eventos por cada interacción del agente; OpenAI Codex exporta eventos de log estructurados y métricas OTel de peticiones a la API, llamadas a herramientas y sesiones; Claude Code exporta métricas y eventos de log, con soporte de trazas en beta. Implicación operativa: se puede montar observabilidad de agentes sobre cualquier backend compatible con OTLP sin instrumentar a mano.

OpenTelemetry · 2026-05-14 · E2

Arize Phoenix: observabilidad open-source de agentes con más de 50 métricas de calidad

Arize Phoenix es la herramienta open-source de observabilidad de agentes: trazado agnóstico de framework, monitorización en producción, experimentos y evaluaciones, con más de 50 métricas basadas en investigación (fidelidad, relevancia, seguridad, toxicidad y detección de alucinaciones). Es gratuita y de código abierto.

Arize AI · 2026-06-01 · E3

¿Te falta cubrir alguna de estas?

Empieza por un assessment: qué capacidades tienes, cuáles te faltan y por dónde da más retorno empezar.

Hablar con nosotros