Vai al contenuto
Se non funziona, non paghi. 30 giorni.
Implementa.
InfrastrutturaAgenti IA··9 min

Osservabilità degli agenti di IA con strumenti aperti: lo stack minimo che puoi davvero montare

Gli strumenti aperti di osservabilità degli agenti di IA coprono oggi tracce correlate, valutazione prima della produzione, attribuzione del costo e rilevamento della deriva, senza piattaforma proprietaria. La tesi: la decisione non è quale strumento, sono quattro livelli distinti — e la prima cosa che si rompe non è nessuno di essi, è la convenzione, ancora in sviluppo e con la documentazione ufficiale trasferita in un altro repository. Cosa copre ogni livello, perché «aperto» significa tre licenze diverse e in quale punto esatto smette di convenire.

Senior AI Infrastructure Implementer

AI Infrastructure Pod

La conversazione parte sempre dal nome di uno strumento. Qualcuno ha visto una demo, qualcuno ha letto un thread, e la domanda che arriva in riunione è: ci ospitiamo Langfuse o paghiamo una piattaforma? È la domanda sbagliata, e si vede tre settimane dopo: il tracciamento c'è, la dashboard esiste, e nessuno sa dire se l'agente risponde peggio del mese scorso.

La tesi in una frase: l'osservabilità degli agenti di IA non è uno strumento, sono quattro livelli che si decidono separatamente, e i pezzi aperti li coprono tutti e quattro oggi. Quello che si rompe non è lo strumento — quelli aperti funzionano — ma le due cose che nessuno mette nella tabella comparativa: la convenzione sui dati è ancora in sviluppo e la sua documentazione ha cambiato casa, e «aperto» significa almeno tre licenze che non ti permettono le stesse cose.

Gli strumenti di osservabilità degli agenti di IA che puoi ospitare tu: quattro livelli, non uno

L'errore di partenza è trattarlo come un acquisto unico. «Osservabilità» si usa come se fosse un prodotto, mentre in un agente sono quattro lavori diversi, che si guastano in modi diversi e di cui non serve quasi mai averli tutti e quattro lo stesso giorno. Separarli è ciò che trasforma una scelta di marca in una decisione di ingegneria.

LivelloA quale domanda rispondeCosa succede senza
Tracce correlateCosa ha fatto l'agente, in che ordine, con quali strumenti e con quale input a ogni passo?Fai debug alla cieca: hai il risultato finale e nessun modo di sapere in quale passo è deviato
Valutazione prima della produzioneQuesta modifica di prompt o di modello batte la baseline o perde?Ogni modifica è una scommessa, e l'unico test è aspettare che qualcuno si lamenti
Attribuzione del costoQuanto costa ogni caso, ogni agente, ogni strumento — non la fattura aggregata?Vedi il totale del fornitore a fine mese e non puoi né attribuirlo né tagliarlo
Rilevamento della derivaRisponde ancora come un mese fa, con lo stesso modello sotto?La qualità scivola lentamente, il monitoraggio classico dà tutto verde, e lo scopre un cliente

I primi due li copre oggi qualunque pezzo aperto serio. Il terzo dipende dall'aver strumentato con la granularità giusta dall'inizio — aggiungerlo dopo significa ri-strumentare. Il quarto non è una funzione che si attiva: è una cadenza che qualcuno deve eseguire, ed è quella che più spesso resta senza proprietario. Perché la deriva produce uno scivolamento e non un errore lo sviluppiamo in cosa succede quando cambia il modello di IA sotto le tue automazioni; qui conta quale livello avrebbe dovuto intercettarlo.

La prima cosa che si rompe non è lo strumento: è la convenzione

Perché i quattro livelli si parlino serve che tutti chiamino le stesse cose allo stesso modo: cos'è una chiamata al modello, cos'è un'invocazione di agente, cos'è un'esecuzione di strumento. Questa è una convenzione semantica, ed è la parte dello stack che quasi nessuno guarda prima di scegliere. È anche la meno consolidata.

Due fatti concreti, entrambi verificabili alla fonte primaria. Primo: le convenzioni GenAI di OpenTelemetry — gli attributi gen_ai.* — sono ancora marcate come in sviluppo, non stabili. Secondo, e questo è quello che ti morderà davvero: quella documentazione non vive più dove ti manderà il motore di ricerca. La pagina storica del repository delle convenzioni semantiche ora dice soltanto che il contenuto è stato spostato nel repository delle convenzioni GenAI e che la vecchia non è più mantenuta.

Sopra a questo circola una seconda convenzione: OpenInference, il livello semantico che mantiene Arize e su cui gira il suo strumento aperto. Non è un problema in sé — gli exporter traducono — ma è il motivo per cui due pezzi entrambi «compatibili con OpenTelemetry» possono arrivare con alberi di span che non combaciano. Scegline una e fanne la norma di casa; non lasciare che decida ogni team che strumenta.

«Aperto» significa tre licenze diverse, e solo una ti permette quello che credi

Qui lo stack aperto assomiglia molto più di quanto si ammetta al dibattito che esiste già nell'automazione. È esattamente la trappola che smontiamo in strumenti open source di automazione con IA: «0 € di licenza» non è «0 € di costo», e «open source» non è sempre quello che la parola suggerisce. Nell'osservabilità degli agenti funziona allo stesso modo, con una sfumatura propria.

PezzoCosa dice la sua documentazioneCosa significa in pratica
LangfuseÈ open source e si può auto-ospitare con Docker sulla tua infrastruttura; alcune funzioni aggiuntive richiedono una chiave di licenzaPer operare la tua flotta il nucleo basta. Nel suo elenco di funzioni di auto-hosting tre sono marcate come enterprise — creatori di organizzazione, API di gestione istanza e personalizzazione dell'interfaccia
Arize PhoenixPubblicato sotto Elastic License 2.0; auto-ospitarlo sulla tua infrastruttura o sul tuo account cloud è gratuito e pienamente permesso, senza funzioni a pagamentoUsato in casa non hai funzioni tagliate. La ELv2 non è approvata dall'OSI e la sua restrizione centrale è offrirlo a terzi come servizio gestito
OpenTelemetryProgetto della CNCF; le convenzioni GenAI sono in sviluppoLa tubatura è la parte più solida e meno discutibile dello stack. L'instabilità è nel vocabolario, non nel trasporto

La lettura operativa: se monti questo per la tua operazione, tutte e tre le licenze te lo permettono e la conversazione legale è corta. Se a un certo punto pensi di rivendere la dashboard ai tuoi clienti come servizio — un'agenzia, un fornitore di servizi gestiti — la ELv2 è precisamente ciò che lo vieta, e conviene saperlo prima di costruirci sopra il business, non dopo.

In quale punto lo stack aperto smette di convenire (e non è un numero di agenti)

La risposta che ci si aspetta qui è una cifra: fino a X agenti ospiti tu, oltre X compri. Quella cifra non esiste, e chi te la dà ti sta vendendo il lato che gli conviene. La soglia non è di volume: è di garanzie.

Lo dice il fornitore stesso nella sua documentazione, ed è la frase più onesta di tutta la categoria. Nella tabella delle opzioni di deployment di Langfuse, l'avvio via Docker Compose è descritto come una singola macchina virtuale senza alta disponibilità, senza scalabilità e senza backup, e l'auto-hosting di produzione — Kubernetes, AWS, Azure, GCP — riporta la responsabilità in una sola colonna: la tua infrastruttura.

Lì sta la soglia vera, e non ha niente a che vedere con quanti agenti hai. Lo stack aperto smette di convenire il giorno in cui la dashboard diventa infrastruttura critica: quando qualcuno da fuori nota il disservizio, quando la traccia è la prova che ti serve per rispondere a un cliente o a un revisore, o quando conservare sei mesi di tracce diventa un requisito e non una preferenza. Quel giorno non stai più scegliendo uno strumento, stai decidendo chi si alza a ripararlo. Che è la stessa domanda — posta per le automazioni — di chi risponde quando si guasta un'automazione.

Conviene inoltre leggere con distacco le cifre di scala che pubblica qualunque fornitore. Langfuse afferma nella sua documentazione di elaborare più di 90 miliardi di osservazioni al mese e di essere usato da 21 delle Fortune 50. Sono dati del produttore sul proprio prodotto, non una misurazione indipendente né un risultato nostro; dicono che il pezzo sostiene carico, non cosa sosterrà in casa tua.

Quando NON montare lo stack aperto

Quattro situazioni in cui questo progetto è una deviazione, non un avanzamento. Tutte e quattro sono reali e tutte e quattro si presentano travestite da buona idea:

  • Hai un agente e non è strumentato. Non ti manca una piattaforma di osservabilità: ti manca il tracciamento. Strumenta prima con la convenzione fissata e decidi dopo dove lo mandi; l'ordine inverso ti fa scegliere lo strumento con zero dati su cosa devi vedere.
  • Nessuno guarderà la dashboard. Una dashboard senza reperibilità non è osservabilità, è spesa di infrastruttura con grafici. Se non c'è una persona con nome e turno, monta prima quello.
  • Il tuo problema è di qualità, non di salute. Se la lamentela è «risponde male», nessuna traccia lo aggiusta: ti serve una rubrica e una banca di casi, che è un lavoro diverso — lo trattiamo in valutare la qualità degli agenti di IA.
  • L'agente scrive in un sistema di registro e non ha ancora la matrice degli accessi. L'osservabilità ti dice cosa ha fatto; non gli impedisce di poterlo fare. Quell'ordine sta in quali permessi dare a un agente di IA, e viene prima.

Cosa si misura il primo mese

Il segnale che lo stack è montato davvero non è che la dashboard carichi. Sono quattro domande a cui prima non potevi rispondere e ora rispondi in un minuto, con la traccia davanti:

  1. Dei guasti del mese, quanti li ha rilevati un allarme e quanti una persona da fuori. È l'unica metrica che dice se la dashboard serve.
  2. Quanto è costato il caso più caro, e perché. Se la risposta è «non si può scomporre», il livello di attribuzione non c'è, grafico dei token o no.
  3. Quanto tempo ti serve per ricostruire cosa è successo in un caso preciso di tre settimane fa. Se sono ore, le tracce ci sono ma la correlazione no.
  4. Quante modifiche di prompt o di modello sono passate senza baseline. Quel numero dovrebbe essere zero, e il primo mese non lo è quasi mai.

Nessuna delle quattro è una metrica dello strumento. Sono metriche dell'operazione, ed è il motivo per cui lo stack aperto non finisce il giorno del deployment: quello che ti dà Docker è la metà economica. Quando quel lavoro continuo il team non può sostenerlo, la conversazione è monitorare l'IA in produzione come funzione, non come dashboard.

La frase per la prossima riunione

La prossima volta che si chiede quale strumento di osservabilità degli agenti montiamo, la risposta utile non è un nome. È: dimmi quale dei quattro livelli ti manca, quale convenzione fissi, e chi si alza quando quello cade. Con queste tre risposte la scelta dello strumento si fa da sola, e quasi sempre è quello aperto.

Lo lasciamo a girare?

Se questo ti ha risuonato, conversazione di 30 minuti senza impegno. Ti diciamo cosa calza, cosa no e il prezzo approssimativo.

Vedi i case study
Osservabilità degli agenti di IA con strumenti aperti: lo stack minimo che puoi davvero montare · Implementa