A conversa começa sempre pelo nome de uma ferramenta. Alguém viu uma demonstração, alguém leu um fio, e a pergunta que chega à reunião é: alojamos o Langfuse ou pagamos uma plataforma? É a pergunta errada, e nota-se três semanas depois: o rastreio está posto, o painel existe, e ninguém sabe dizer se o agente responde pior do que no mês passado.
A tese numa frase: a observabilidade de agentes de IA não é uma ferramenta, são quatro camadas que se decidem em separado, e as peças abertas cobrem as quatro hoje. O que parte não é a ferramenta — as abertas funcionam — mas as duas coisas que ninguém põe na tabela comparativa: a convenção de dados está ainda em desenvolvimento e a sua documentação mudou de casa, e «aberto» significa pelo menos três licenças que não te permitem o mesmo.
As ferramentas de observabilidade de agentes de IA que podes alojar tu: quatro camadas, não uma
O erro de partida é tratar isto como uma compra única. «Observabilidade» usa-se como se fosse um produto, quando num agente são quatro trabalhos diferentes, que falham de formas diferentes e de que quase nunca precisas dos quatro no mesmo dia. Separá-los é o que transforma uma escolha de marca numa decisão de engenharia.
| Camada | A que pergunta responde | O que acontece sem ela |
|---|---|---|
| Rastreios correlacionados | O que fez o agente, em que ordem, com que ferramentas e com que entrada em cada passo? | Depuras às cegas: tens o resultado final e nenhuma forma de saber em que passo se torceu |
| Avaliação antes da produção | Esta alteração de prompt ou de modelo é melhor do que a linha de base, ou pior? | Cada alteração é uma aposta, e o único teste é esperar que alguém se queixe |
| Atribuição de custo | Quanto custa cada caso, cada agente, cada ferramenta — e não a fatura agregada? | Vês o total do fornecedor no fim do mês e não o consegues atribuir nem cortar |
| Deteção de desvio | Continua a responder como há um mês, com o mesmo modelo por baixo? | A qualidade escorrega devagar, a monitorização clássica dá tudo verde, e descobre-o um cliente |
As duas primeiras cobre-as hoje qualquer peça aberta séria. A terceira depende de teres instrumentado com a granularidade certa desde o início — acrescentá-la depois é reinstrumentar. A quarta não é uma função que se liga: é uma cadência que alguém tem de executar, e é a que mais fica sem dono. Porque é que o desvio produz um escorregar e não um erro, desenvolvemo-lo em o que acontece quando muda o modelo de IA por baixo das tuas automatizações; aqui o que conta é que camada o devia ter apanhado.
A primeira coisa que parte não é a ferramenta: é a convenção
Para que as quatro camadas falem entre si é preciso que todas chamem o mesmo às mesmas coisas: o que é uma chamada ao modelo, o que é uma invocação de agente, o que é uma execução de ferramenta. Isso é uma convenção semântica, e é a parte da stack que quase ninguém olha antes de escolher. É também a menos assente.
Dois factos concretos, ambos verificáveis na fonte primária. Primeiro: as convenções GenAI do OpenTelemetry — os atributos gen_ai.* — continuam marcadas como em desenvolvimento, não estáveis. Segundo, e é este que te vai morder a sério: essa documentação já não vive onde o teu motor de busca te vai mandar. A página histórica do repositório de convenções semânticas diz agora apenas que o conteúdo foi transferido para o repositório das convenções GenAI e que a antiga já não é mantida.
Por cima disso circula uma segunda convenção: OpenInference, a camada semântica que a Arize mantém e sobre a qual corre a sua ferramenta aberta. Não é um problema em si — os exportadores traduzem — mas é a razão pela qual duas peças ambas «compatíveis com OpenTelemetry» podem chegar com árvores de spans que não encaixam. Escolhe uma e faz dela a norma de casa; não deixes que decida cada equipa que instrumenta.
«Aberto» significa três licenças diferentes, e só uma te permite o que achas
É aqui que a stack aberta se parece muito mais do que se admite com o debate que já existe na automatização. É exatamente a armadilha que desmontamos em ferramentas open source de automatização com IA: «0 € de licença» não é «0 € de custo», e «open source» não é sempre o que a palavra sugere. Na observabilidade de agentes passa-se o mesmo, com uma nuance própria.
| Peça | O que diz a sua própria documentação | O que significa na prática |
|---|---|---|
| Langfuse | É open source e pode ser auto-alojado com Docker na tua infraestrutura; algumas funções complementares exigem chave de licença | Para operar a tua frota o núcleo basta. Na sua lista de funções de auto-alojamento há três marcadas como empresariais — criadores de organização, API de gestão de instância e personalização de interface |
| Arize Phoenix | Publicado sob Elastic License 2.0; auto-alojá-lo na tua infraestrutura ou na tua conta de nuvem é gratuito e plenamente permitido, sem funções pagas | Usado de portas adentro, não tens funções cortadas. A ELv2 não está aprovada pela OSI e a sua restrição central é oferecê-lo a terceiros como serviço gerido |
| OpenTelemetry | Projeto da CNCF; as convenções GenAI estão em desenvolvimento | A canalização é a parte mais sólida e menos discutível da stack. A instabilidade está no vocabulário, não no transporte |
A leitura operacional: se montas isto para a tua própria operação, as três licenças permitem-to e a conversa jurídica é curta. Se em algum momento pensas revender o painel aos teus clientes como serviço — uma agência, um prestador de serviços geridos — a ELv2 é precisamente o que o proíbe, e convém sabê-lo antes de construir o negócio por cima, não depois.
Em que ponto a stack aberta deixa de compensar (e não é um número de agentes)
A resposta que se espera aqui é um número: até X agentes alojas tu, acima de X compras. Esse número não existe, e quem to der está a vender-te o lado que lhe convém. O limiar não é de volume: é de garantias.
Di-lo o próprio fabricante na sua documentação, e é a frase mais honesta de toda a categoria. Na tabela de opções de implementação do Langfuse, o arranque por Docker Compose é descrito como uma única máquina virtual sem alta disponibilidade, sem escalamento e sem cópias de segurança, e o auto-alojamento de produção — Kubernetes, AWS, Azure, GCP — apresenta a responsabilidade numa só coluna: a tua infraestrutura.
Aí está o limiar verdadeiro, e não tem nada a ver com quantos agentes tens. A stack aberta deixa de compensar no dia em que o painel passa a ser infraestrutura crítica: quando alguém de fora nota a falha, quando o rastreio é a prova de que precisas para responder a um cliente ou a um auditor, ou quando conservar seis meses de rastreios se torna um requisito e não uma preferência. Nesse dia já não estás a escolher uma ferramenta, estás a decidir quem se levanta para a arranjar. Que é a mesma pergunta — feita para automatizações — de quem responde quando cai uma automatização.
Convém também ler com distância os números de escala que publica qualquer fabricante. O Langfuse afirma na sua documentação processar mais de 90 mil milhões de observações por mês e ser usado por 21 das Fortune 50. São dados do fabricante sobre o seu próprio produto, não uma medição independente nem um resultado nosso; dizem que a peça aguenta carga, não o que vai aguentar na tua casa.
Quando NÃO montar a stack aberta
Quatro situações em que este projeto é um desvio, não um avanço. As quatro são reais e as quatro se apresentam disfarçadas de boa ideia:
- Tens um agente e não está instrumentado. Não te falta uma plataforma de observabilidade: falta-te o rastreio. Instrumenta primeiro com a convenção fixada e decide depois para onde o mandas; a ordem inversa faz-te escolher ferramenta com zero dados sobre o que precisas de ver.
- Ninguém vai olhar para o painel. Um painel sem piquete não é observabilidade, é despesa de infraestrutura com gráficos. Se não há uma pessoa com nome e turno, monta primeiro isso.
- O teu problema é de qualidade, não de saúde. Se a queixa é «responde mal», nenhum rastreio o arranja: o que precisas é de uma grelha e de um banco de casos, que é um trabalho diferente — tratamo-lo em avaliar a qualidade dos agentes de IA.
- O agente escreve num sistema de registo e ainda não tem a matriz de acessos. A observabilidade diz-te o que ele fez; não impede que o possa fazer. Essa ordem está em que permissões dar a um agente de IA, e vem antes.
O que se mede no primeiro mês
O sinal de que a stack está mesmo montada não é o painel carregar. São quatro perguntas a que antes não conseguias responder e agora respondes num minuto, com o rastreio à frente:
- Das falhas do mês, quantas foram detetadas por um alerta e quantas por uma pessoa de fora. É a única métrica que diz se o painel serve.
- Quanto custou o caso mais caro, e porquê. Se a resposta é «não se consegue desagregar», a camada de atribuição não está lá, gráfico de tokens ou não.
- Quanto tempo levas a reconstruir o que aconteceu num caso concreto de há três semanas. Se são horas, os rastreios estão lá mas a correlação não.
- Quantas alterações de prompt ou de modelo passaram sem linha de base. Esse número devia ser zero, e no primeiro mês quase nunca é.
Nenhuma das quatro é uma métrica da ferramenta. São métricas da operação, e é a razão pela qual a stack aberta não termina no dia da implementação: o que o Docker te dá é a metade barata. Quando esse trabalho contínuo a equipa não o consegue sustentar, a conversa é monitorizar a IA em produção como função, não como painel.
A frase para a próxima reunião
Na próxima vez que alguém perguntar que ferramenta de observabilidade de agentes montamos, a resposta útil não é um nome. É: diz-me qual das quatro camadas te falta, que convenção vais fixar, e quem se levanta quando aquilo cair. Com essas três respostas a escolha da ferramenta faz-se sozinha, e quase sempre é a aberta.