Saltar para o conteúdo
Se não funciona, não pagas. 30 dias.
Implementa.
← All capabilities

Observability

Phase: Operate

See what AI does in production: every run, its cost, and why it failed.

Observability is being able to look inside AI in production: what went in, what it decided, which tools it used, how much it cost and where it went wrong. It’s the difference between operating a system and praying it works.

What it includes

  • Log every run: input, steps, output, cost and latency.
  • Trace the agent’s decisions so you can reconstruct why it did what it did.
  • Alerts when something drifts from normal (cost, errors, latency).
  • Dashboards per process and per agent for the operational owner, not just engineering.

When you need it

  • An agent failed at a customer and you can’t reconstruct what happened.
  • AI cost is rising and nobody knows which process is driving it.
  • You learn about problems from the customer, not from your dashboards.

How it’s measured

  • Time to detect an incident (how long until the alarm fires).
  • Share of runs traceable end-to-end.
  • Cost per process visible in near real time.

Common mistakes

  • Logging only the final output and not the steps: when it fails, there’s no way to know why.
  • Dashboards only engineering understands while the process owner flies blind.
  • Alerting on everything until nobody pays attention to any alert.

FAQ

Aren’t observability and evaluation the same thing?
No. Evaluation measures quality against known cases, usually before shipping. Observability watches what happens in production with real traffic. You need both: one prevents, the other detects.
When do you set up observability?
Before scaling. A pilot can live without it; a function with several agents in production and no observability is a function you don’t control.

Related capabilities

Recent signals

Trends, practices, tools, cases and market data for this capability, with sources. Updated weekly.

Trends

El Hype Cycle de IA agéntica de Gartner incorpora perfiles propios de gobierno, seguridad y coste junto a las tecnologías núcleo

En su Hype Cycle dedicado a la IA agéntica, Gartner mapea decenas de innovaciones a lo largo del desarrollo de agentes, integración, interacción con humanos, gestión y casos de uso. La señal relevante para la observabilidad es que junto a las tecnologías agénticas núcleo emergen perfiles propios centrados en gobierno, seguridad y coste (incluido FinOps para IA agéntica), y que el analista nombra el "agent-washing" como problema explícito de mercado, señalando las brechas de seguridad, gobierno y competencias como los frenos a la adopción en producción.

Gartner · 2026-04-02 · E3

La observabilidad de agentes se consolida como categoría con un shortlist claro en 2026

El shortlist práctico de observabilidad de agentes en 2026 lo forman Arize AX/Phoenix, LangSmith, Langfuse, Braintrust, Datadog y Opik. LangSmith encaja con equipos LangGraph/LangChain (traza modelos, herramientas, recuperación y pasos del agente); Arize destaca por trazado agnóstico y evaluación integrada. La categoría deja de ser experimental.

Latitude — Best AI Agent Observability Tools 2026 · 2026-06-01 · E3

Practices

Por defecto la telemetría GenAI de OpenTelemetry no captura prompts ni argumentos de herramientas: el contenido es opt-in por riesgo de datos sensibles

Las convenciones GenAI de OpenTelemetry incluyen solo metadatos por defecto —nombre del modelo, recuento de tokens, duraciones— porque el contenido de prompts y argumentos de herramientas puede contener datos sensibles. Activar la captura de contenido puebla los atributos de span con mensajes completos, prompts de sistema, esquemas de herramientas, argumentos y resultados. Es una decisión de gobernanza además de técnica: la traza que sirve para depurar un agente es también la traza que guarda datos de cliente.

OpenTelemetry · 2026-05-14 · E2

Tools

El mercado de observabilidad de agentes en 2026: Braintrust, LangSmith, Arize Phoenix, Helicone, Galileo, Datadog LLM Observability y AgentOps

Guía de MLflow sobre observabilidad de agentes: la disciplina cubre cuatro pilares —monitorización, trazado, evaluación y gobierno— y las plataformas se reparten a lo largo del espectro que va de la recogida de telemetría al control con gobierno primero (LangSmith destaca en trazas y evaluación con integración profunda de LangChain). La pieza técnica que hace comparables las trazas entre frameworks es la especificación GenAI de OpenTelemetry: un esquema compartido permite ingerir en el mismo backend trazas de distintos frameworks sin parseo a medida.

MLflow · 2026-06-11 · E3

Los asistentes de código ya emiten telemetría OpenTelemetry nativa: Copilot, Codex y Claude Code exportan trazas, métricas y eventos de cada interacción

Post de OpenTelemetry (James Newton-King, Microsoft) sobre observabilidad de GenAI con las convenciones semánticas del proyecto. VS Code Copilot emite trazas, métricas y eventos por cada interacción del agente; OpenAI Codex exporta eventos de log estructurados y métricas OTel de peticiones a la API, llamadas a herramientas y sesiones; Claude Code exporta métricas y eventos de log, con soporte de trazas en beta. Implicación operativa: se puede montar observabilidad de agentes sobre cualquier backend compatible con OTLP sin instrumentar a mano.

OpenTelemetry · 2026-05-14 · E2

Arize Phoenix: observabilidad open-source de agentes con más de 50 métricas de calidad

Arize Phoenix es la herramienta open-source de observabilidad de agentes: trazado agnóstico de framework, monitorización en producción, experimentos y evaluaciones, con más de 50 métricas basadas en investigación (fidelidad, relevancia, seguridad, toxicidad y detección de alucinaciones). Es gratuita y de código abierto.

Arize AI · 2026-06-01 · E3

Missing any of these?

Start with an assessment: which capabilities you have, which you’re missing, and where it pays off most to start.

Talk to us