Un pilota che classifica le richieste dei clienti viene validato a gennaio. Funziona: casi reali, revisione umana, via libera del comitato, in produzione. A giugno arrivano le lamentele: richieste instradate al reparto sbagliato, risposte fuori tema. Il team fa la cosa ragionevole e controlla prompt, modello e configurazione. Tutto è esattamente come a gennaio. «Nessuno ha cambiato niente», concludono, e la conversazione scivola verso «l’IA non è affidabile».
La tesi in una riga: quando un agente peggiora senza che nessuno tocchi il codice, a cambiare sono i suoi input, e il test di gennaio ha dimostrato solo che funzionava per le persone, i moduli e il calendario di gennaio. «Nessuno ha cambiato niente» non è la difesa del sistema: è la diagnosi.
Perché un agente IA peggiora nel tempo se il codice è lo stesso
Perché un agente non è un programma che fa sempre la stessa cosa: è una funzione di ciò che riceve, e ciò che riceve cambia. Una validazione misura il comportamento su un campione preciso di input. Se la realtà si sposta da quel campione, il numero visto nel test non si sposta con lei. È lo stesso motivo per cui una percentuale di accuratezza non basta in produzione: la precisione non è una proprietà del modello, ma del sistema più i suoi dati, e i dati si muovono.
Quattro modi in cui gli input cambiano senza avvisare
- Il calendario. Campagne, chiusure di trimestre, alta stagione, il mese delle ferie. L’agente validato sul traffico di un mese tranquillo incontra, in un altro mese, un altro tipo di richiesta: più urgente, più ambigua.
- Persone nuove che scrivono in modo diverso. Un canale nuovo, un cliente di un altro paese, un segmento che prima non arrivava. Messaggi più lunghi, un’altra lingua mescolata, altre abbreviazioni. Il campione del test non li conteneva.
- Un sistema a monte che cambia. Un modulo che aggiunge un campo facoltativo, un CRM che cambia il formato di una data, un fornitore che rinomina una colonna. Nessuno avvisa l’agente perché nessuno sa che quella dipendenza esiste.
- Il business cambia e il prompt no. Un prodotto nuovo, prezzi nuovi, una politica dei resi diversa. Le istruzioni continuano a descrivere l’azienda di gennaio.
Deriva dell’input e deriva del modello non si risolvono allo stesso modo
Meglio non mescolarle, perché la prima domanda di una diagnosi è quale delle due hai. La deriva del modello viene dal fornitore: aggiorna o ritira una versione e lo stesso prompt si comporta in modo diverso. La si contiene con la versione bloccata e una batteria di casi eseguita a ogni cambio, come spieghiamo nella guida su come cambiare modello senza rompere le tue automazioni.
La deriva dell’input si verifica anche se blocchi tutto. Puoi congelare modello, prompt e infrastruttura per un anno: se il mondo che lo alimenta cambia, l’agente peggiora comunque. Per questo la reazione abituale, provare un altro modello, di solito è un errore, come sosteniamo in cambiare modello non aggiusta il tuo processo: sposti il problema e in più paghi una migrazione.
Una domanda da un minuto separa i due casi: è cambiato il sistema o è cambiato ciò che ci entra? Se modello, prompt e integrazioni sono come prima e le prestazioni calano, parti dagli input.
Come individuare la deriva dell’input prima del cliente
Un segnale che arriva dalle lamentele arriva tardi: a quel punto hai già settimane di errori. I quattro controlli che lo anticipano costano poco, ma devono esistere prima di averne bisogno:
- Conserva l’istantanea della validazione. Il campione di input su cui l’agente è stato approvato è il tuo riferimento. Se non l’hai conservato, non hai nulla con cui confrontare.
- Confronta ogni settimana ciò che entra con quell’istantanea. Non serve statistica sofisticata: lunghezza dei messaggi, lingua, ripartizione per categoria, campi vuoti, percentuale di casi che l’agente non aveva mai visto. Un cambio brusco in uno qualsiasi è l’allarme.
- Tieni d’occhio le eccezioni per tipo di input. Il tasso di casi che l’agente passa a una persona, o che una persona corregge, sale prima delle lamentele e, scomposto per tipo, ti dice dove si sta muovendo la realtà.
- Riesegui le valutazioni con casi recenti. Una batteria fissa di gennaio ti dice solo ciò che già sapevi. Aggiungi ogni mese nuovi casi reali, etichettati da una persona, come spiegato in le valutazioni per sapere se la tua IA funziona davvero.
Il primo passo, peraltro, esiste solo se hai preso una base di partenza. È lo stesso principio del misurare le prestazioni delle tue automazioni: il numero che non hai preso prima non si può prendere dopo.
Cosa fare quando l’input si è già spostato
Ci sono tre risposte, e la scelta dipende da quanto si è spostato e da quanto costa l’errore:
- Aggiornare il riferimento. Inserire i casi nuovi nella validazione e ritoccare istruzioni ed esempi. È la risposta quando il cambiamento è stabile e l’agente può imparare a coprirlo.
- Ampliare il perimetro con un percorso dedicato. Se è comparso un tipo di input nuovo e distinto (un’altra lingua, un altro canale), trattalo come un caso nuovo con la sua validazione, non come una variante del precedente.
- Ridurre l’autonomia nel frattempo. Ciò che l’agente non riconosce più va a una persona, e l’agente passa da decidere a proporre. È il meccanismo dei livelli di autonomia di un agente: scendere di un gradino è reversibile; spegnerlo non sempre.
Niente di tutto questo funziona senza un responsabile. La deriva dell’input non la individua nessuno in particolare perché non è il lavoro di nessuno in particolare: né di chi ha costruito l’agente, ormai su un altro progetto, né di chi lo usa. Servono una persona con un nome, una cadenza (settimanale, per cominciare) e l’autorità di modificare l’agente quando i dati lo richiedono. Il resto del piano è nella guida sulla manutenzione delle automazioni IA. E se preferisci non montarlo né sostenerlo tu, è ciò che facciamo quando monitoriamo l’IA in produzione: strumentare input, eccezioni e casi di riferimento, e intervenire quando si muovono.
Come capire se sta succedendo a te adesso
- Nessuno sa mostrarti il campione di input su cui l’agente è stato approvato.
- L’ultima volta che sono stati aggiunti nuovi casi alla validazione è stato prima del lancio.
- Le eccezioni si contano in totale, non per tipo di input.
- Se chiedi chi controlla tutto questo, la risposta è «il team», non una persona.
Se due su quattro sono vere, probabilmente il tuo agente si è già spostato e ti manca solo lo strumento per vederlo.
La frase da portarsi via: un agente non peggiora perché invecchia, peggiora perché il mondo continua a cambiare e nessuno ha ricontrollato che parlassero ancora la stessa lingua.