Saltar para o conteúdo
Se não funciona, não pagas. 30 dias.
Implementa.
InfraestruturaAgentes IA··9 min

Observabilidade de agentes de IA com ferramentas abertas: a stack mínima que consegues mesmo montar

As ferramentas abertas de observabilidade de agentes de IA cobrem hoje rastreios correlacionados, avaliação antes da produção, atribuição de custo e deteção de desvio, sem plataforma proprietária. A tese: a decisão não é qual ferramenta, são quatro camadas distintas — e a primeira coisa que parte não é nenhuma delas, é a convenção, ainda em desenvolvimento e com a documentação oficial mudada de repositório. O que cobre cada camada, porque «aberto» significa três licenças diferentes e em que ponto exato deixa de compensar.

Senior AI Infrastructure Implementer

AI Infrastructure Pod

A conversa começa sempre pelo nome de uma ferramenta. Alguém viu uma demonstração, alguém leu um fio, e a pergunta que chega à reunião é: alojamos o Langfuse ou pagamos uma plataforma? É a pergunta errada, e nota-se três semanas depois: o rastreio está posto, o painel existe, e ninguém sabe dizer se o agente responde pior do que no mês passado.

A tese numa frase: a observabilidade de agentes de IA não é uma ferramenta, são quatro camadas que se decidem em separado, e as peças abertas cobrem as quatro hoje. O que parte não é a ferramenta — as abertas funcionam — mas as duas coisas que ninguém põe na tabela comparativa: a convenção de dados está ainda em desenvolvimento e a sua documentação mudou de casa, e «aberto» significa pelo menos três licenças que não te permitem o mesmo.

As ferramentas de observabilidade de agentes de IA que podes alojar tu: quatro camadas, não uma

O erro de partida é tratar isto como uma compra única. «Observabilidade» usa-se como se fosse um produto, quando num agente são quatro trabalhos diferentes, que falham de formas diferentes e de que quase nunca precisas dos quatro no mesmo dia. Separá-los é o que transforma uma escolha de marca numa decisão de engenharia.

CamadaA que pergunta respondeO que acontece sem ela
Rastreios correlacionadosO que fez o agente, em que ordem, com que ferramentas e com que entrada em cada passo?Depuras às cegas: tens o resultado final e nenhuma forma de saber em que passo se torceu
Avaliação antes da produçãoEsta alteração de prompt ou de modelo é melhor do que a linha de base, ou pior?Cada alteração é uma aposta, e o único teste é esperar que alguém se queixe
Atribuição de custoQuanto custa cada caso, cada agente, cada ferramenta — e não a fatura agregada?Vês o total do fornecedor no fim do mês e não o consegues atribuir nem cortar
Deteção de desvioContinua a responder como há um mês, com o mesmo modelo por baixo?A qualidade escorrega devagar, a monitorização clássica dá tudo verde, e descobre-o um cliente

As duas primeiras cobre-as hoje qualquer peça aberta séria. A terceira depende de teres instrumentado com a granularidade certa desde o início — acrescentá-la depois é reinstrumentar. A quarta não é uma função que se liga: é uma cadência que alguém tem de executar, e é a que mais fica sem dono. Porque é que o desvio produz um escorregar e não um erro, desenvolvemo-lo em o que acontece quando muda o modelo de IA por baixo das tuas automatizações; aqui o que conta é que camada o devia ter apanhado.

A primeira coisa que parte não é a ferramenta: é a convenção

Para que as quatro camadas falem entre si é preciso que todas chamem o mesmo às mesmas coisas: o que é uma chamada ao modelo, o que é uma invocação de agente, o que é uma execução de ferramenta. Isso é uma convenção semântica, e é a parte da stack que quase ninguém olha antes de escolher. É também a menos assente.

Dois factos concretos, ambos verificáveis na fonte primária. Primeiro: as convenções GenAI do OpenTelemetry — os atributos gen_ai.* — continuam marcadas como em desenvolvimento, não estáveis. Segundo, e é este que te vai morder a sério: essa documentação já não vive onde o teu motor de busca te vai mandar. A página histórica do repositório de convenções semânticas diz agora apenas que o conteúdo foi transferido para o repositório das convenções GenAI e que a antiga já não é mantida.

Por cima disso circula uma segunda convenção: OpenInference, a camada semântica que a Arize mantém e sobre a qual corre a sua ferramenta aberta. Não é um problema em si — os exportadores traduzem — mas é a razão pela qual duas peças ambas «compatíveis com OpenTelemetry» podem chegar com árvores de spans que não encaixam. Escolhe uma e faz dela a norma de casa; não deixes que decida cada equipa que instrumenta.

«Aberto» significa três licenças diferentes, e só uma te permite o que achas

É aqui que a stack aberta se parece muito mais do que se admite com o debate que já existe na automatização. É exatamente a armadilha que desmontamos em ferramentas open source de automatização com IA: «0 € de licença» não é «0 € de custo», e «open source» não é sempre o que a palavra sugere. Na observabilidade de agentes passa-se o mesmo, com uma nuance própria.

PeçaO que diz a sua própria documentaçãoO que significa na prática
LangfuseÉ open source e pode ser auto-alojado com Docker na tua infraestrutura; algumas funções complementares exigem chave de licençaPara operar a tua frota o núcleo basta. Na sua lista de funções de auto-alojamento há três marcadas como empresariais — criadores de organização, API de gestão de instância e personalização de interface
Arize PhoenixPublicado sob Elastic License 2.0; auto-alojá-lo na tua infraestrutura ou na tua conta de nuvem é gratuito e plenamente permitido, sem funções pagasUsado de portas adentro, não tens funções cortadas. A ELv2 não está aprovada pela OSI e a sua restrição central é oferecê-lo a terceiros como serviço gerido
OpenTelemetryProjeto da CNCF; as convenções GenAI estão em desenvolvimentoA canalização é a parte mais sólida e menos discutível da stack. A instabilidade está no vocabulário, não no transporte

A leitura operacional: se montas isto para a tua própria operação, as três licenças permitem-to e a conversa jurídica é curta. Se em algum momento pensas revender o painel aos teus clientes como serviço — uma agência, um prestador de serviços geridos — a ELv2 é precisamente o que o proíbe, e convém sabê-lo antes de construir o negócio por cima, não depois.

Em que ponto a stack aberta deixa de compensar (e não é um número de agentes)

A resposta que se espera aqui é um número: até X agentes alojas tu, acima de X compras. Esse número não existe, e quem to der está a vender-te o lado que lhe convém. O limiar não é de volume: é de garantias.

Di-lo o próprio fabricante na sua documentação, e é a frase mais honesta de toda a categoria. Na tabela de opções de implementação do Langfuse, o arranque por Docker Compose é descrito como uma única máquina virtual sem alta disponibilidade, sem escalamento e sem cópias de segurança, e o auto-alojamento de produção — Kubernetes, AWS, Azure, GCP — apresenta a responsabilidade numa só coluna: a tua infraestrutura.

Aí está o limiar verdadeiro, e não tem nada a ver com quantos agentes tens. A stack aberta deixa de compensar no dia em que o painel passa a ser infraestrutura crítica: quando alguém de fora nota a falha, quando o rastreio é a prova de que precisas para responder a um cliente ou a um auditor, ou quando conservar seis meses de rastreios se torna um requisito e não uma preferência. Nesse dia já não estás a escolher uma ferramenta, estás a decidir quem se levanta para a arranjar. Que é a mesma pergunta — feita para automatizações — de quem responde quando cai uma automatização.

Convém também ler com distância os números de escala que publica qualquer fabricante. O Langfuse afirma na sua documentação processar mais de 90 mil milhões de observações por mês e ser usado por 21 das Fortune 50. São dados do fabricante sobre o seu próprio produto, não uma medição independente nem um resultado nosso; dizem que a peça aguenta carga, não o que vai aguentar na tua casa.

Quando NÃO montar a stack aberta

Quatro situações em que este projeto é um desvio, não um avanço. As quatro são reais e as quatro se apresentam disfarçadas de boa ideia:

  • Tens um agente e não está instrumentado. Não te falta uma plataforma de observabilidade: falta-te o rastreio. Instrumenta primeiro com a convenção fixada e decide depois para onde o mandas; a ordem inversa faz-te escolher ferramenta com zero dados sobre o que precisas de ver.
  • Ninguém vai olhar para o painel. Um painel sem piquete não é observabilidade, é despesa de infraestrutura com gráficos. Se não há uma pessoa com nome e turno, monta primeiro isso.
  • O teu problema é de qualidade, não de saúde. Se a queixa é «responde mal», nenhum rastreio o arranja: o que precisas é de uma grelha e de um banco de casos, que é um trabalho diferente — tratamo-lo em avaliar a qualidade dos agentes de IA.
  • O agente escreve num sistema de registo e ainda não tem a matriz de acessos. A observabilidade diz-te o que ele fez; não impede que o possa fazer. Essa ordem está em que permissões dar a um agente de IA, e vem antes.

O que se mede no primeiro mês

O sinal de que a stack está mesmo montada não é o painel carregar. São quatro perguntas a que antes não conseguias responder e agora respondes num minuto, com o rastreio à frente:

  1. Das falhas do mês, quantas foram detetadas por um alerta e quantas por uma pessoa de fora. É a única métrica que diz se o painel serve.
  2. Quanto custou o caso mais caro, e porquê. Se a resposta é «não se consegue desagregar», a camada de atribuição não está lá, gráfico de tokens ou não.
  3. Quanto tempo levas a reconstruir o que aconteceu num caso concreto de há três semanas. Se são horas, os rastreios estão lá mas a correlação não.
  4. Quantas alterações de prompt ou de modelo passaram sem linha de base. Esse número devia ser zero, e no primeiro mês quase nunca é.

Nenhuma das quatro é uma métrica da ferramenta. São métricas da operação, e é a razão pela qual a stack aberta não termina no dia da implementação: o que o Docker te dá é a metade barata. Quando esse trabalho contínuo a equipa não o consegue sustentar, a conversa é monitorizar a IA em produção como função, não como painel.

A frase para a próxima reunião

Na próxima vez que alguém perguntar que ferramenta de observabilidade de agentes montamos, a resposta útil não é um nome. É: diz-me qual das quatro camadas te falta, que convenção vais fixar, e quem se levanta quando aquilo cair. Com essas três respostas a escolha da ferramenta faz-se sozinha, e quase sempre é a aberta.

Deixamos isto a funcionar?

Se isto te ressoou, conversa de 30 minutos sem compromisso. Dizemos-te o que encaixa, o que não e o preço aproximado.

Ver casos
Observabilidade de agentes de IA com ferramentas abertas: a stack mínima que consegues mesmo montar · Implementa