«Qual è il modello migliore?» è la domanda di chi non ne ha ancora messo uno in produzione
La conversazione comincia sempre allo stesso modo. Qualcuno apre una classifica, indica il primo posto e chiede se costruiamo l'agente con quello. È una domanda legittima ed è mal posta, perché dà per scontato che un agente usi un modello. Gli agenti che reggono la produzione non ne usano uno: ne usano diversi. E la decisione che conta davvero non è quale, è la distribuzione.
Il motivo è architetturale ed è noioso. Un agente non fa un compito: fa una catena. Legge una e-mail e capisce di cosa parla. Cerca nella tua documentazione e tira fuori tre passaggi. Redige una risposta che leggerà un tuo cliente. Decide se esce da sola o se passa da una persona. Quattro passaggi, quattro esigenze diverse: classificare una e-mail in sei categorie è un problema risolto da anni; scrivere ciò che legge il tuo cliente è dove ci metti la faccia. Pagare il modello più caro per tutti e quattro è mettere il tuo avvocato migliore a fare fotocopie.
Non è una nostra opinione. La guida di OpenAI per costruire agenti lo dice senza giri di parole: i modelli hanno punti di forza e compromessi diversi su complessità del compito, latenza e costo, e non tutti i compiti richiedono il modello più intelligente. Il loro esempio è esattamente quello di sopra: un recupero semplice o una classificazione di intento può essere gestita da un modello più piccolo e veloce, mentre decidere se approvare un rimborso beneficia di uno più capace. E raccomandano di valutare più modelli per compiti diversi dello stesso flusso invece di uno per tutto. Fonte: A practical guide to building agents, OpenAI, consultato il 12 settembre 2026.
Questa guida parla di prendere quella decisione con criterio: i tre assi che decidono davvero, l'ordine in cui si percorrono, come si distribuisce e quale livello serve perché cambiare modello non sia un cantiere. Cosa non è: una tabella dei «migliori LLM del 2026» — quella scade prima che la pubblichiamo — né la fattura dell'IA in produzione, che è un'altra conversazione con altri numeri.
I tre assi che decidono davvero
Tolto il rumore, la scelta poggia su tre domande. Nessuna delle tre si risolve leggendo la scheda del modello: tutte e tre si risolvono misurando a casa tua.
| Asse | La domanda a cui risponde | Come si misura nel tuo caso |
|---|---|---|
| Accuratezza sul tuo compito | Quanti dei miei casi reali risolve bene? | Una batteria di 30-50 casi tuoi con la risposta corretta scritta accanto |
| Latenza | Regge il canale in cui vive l'agente? | Il 95esimo percentile del tempo di risposta, mai la media |
| Costo per caso risolto | Quanto costa risolverne uno da capo a fondo? | Costo del flusso completo diviso i casi risolti, non il prezzo per milione di token |
L'accuratezza è l'asse che quasi tutti saltano, perché è quello che dà lavoro. «Accuratezza» non è un voto generale: è la percentuale dei TUOI casi che escono bene. Per averla serve la parte noiosa — trenta o cinquanta casi reali, e-mail vere con i loro errori di battitura e i loro allegati strani, con la risposta corretta scritta accanto. Senza quella batteria non stai scegliendo un modello: hai un'opinione sui modelli, che è un'altra cosa e in riunione non regge.
La latenza non è un numero assoluto: è un numero contro un canale. Una chat sul tuo sito ha un budget di secondi perché c'è una persona che guarda lo schermo. Un processo notturno che riconcilia fatture ha tutta la notte. Lo stesso modello è veloce in uno e lento nell'altro, quindi «è veloce?» non significa nulla finché non dici dove. Anthropic lo presenta per quello che è, uno scambio: i sistemi agentici scambiano spesso latenza e costo con migliori prestazioni sul compito, e va deciso quando quello scambio conviene. Fonte: Building effective agents, Anthropic, 19 dicembre 2024, consultato il 12 settembre 2026.
Il prezzo per milione di token è un prezzo di listino, non la tua fattura. Un modello economico che ha bisogno di tre tentativi, lascia metà dei campi vuoti e finisce per escalare a una persona ti costa più di uno caro che azzecca al primo colpo. L'unità corretta è il caso risolto: costo totale del flusso — tutte le chiamate, tutti i ritentativi, compresi quelli del passaggio fallito — diviso i casi usciti bene senza che nessuno li toccasse.
La classifica pubblica non sa nulla del tuo lavoro
Con i tre assi sul tavolo si capisce perché la classifica non decide. Una classifica pubblica misura un esame standardizzato: domande da quiz, problemi di codice giocattolo, rompicapi logici. Il tuo compito non è quello. Il tuo compito sono le e-mail dei tuoi clienti, il tuo gergo interno, i tuoi PDF scansionati male e la tua politica di resi, e nessuna di queste quattro cose compare in una tabella. L'abbiamo spiegato a suo tempo: i benchmark degli LLM non predicono il tuo risultato.
A cosa serve una classifica pubblica è l'opposto di come viene usata: serve a scartare, non a scegliere. Ti dice quali modelli sono nella conversazione e quali sono rimasti indietro di due generazioni, e questo ti risparmia di valutarne quindici. Da lì, la lista corta — due, tre — si ordina con la tua batteria di casi. Quell'ordine coincide di rado con la classifica, e quando coincide è una coincidenza su cui non puoi contare la volta dopo.
La distribuzione: economico per classificare, costoso per decidere
Il pattern ha un nome ed è documentato. Anthropic lo chiama routing: un primo passaggio classifica l'input e lo indirizza al trattamento specializzato che gli compete. La sua utilità, spiegano, è separare le responsabilità e poter scrivere prompt più specializzati, perché senza quella distribuzione ottimizzare per un tipo di input peggiora la resa sugli altri. E uno degli esempi che portano è letteralmente la distribuzione per costo: mandare le domande facili e comuni a modelli piccoli ed economici, e quelle difficili o insolite a modelli più capaci. Fonte: Building effective agents, Anthropic, 19 dicembre 2024, consultato il 12 settembre 2026.
Tradotto nei passaggi di un agente tipico, la distribuzione di solito cade così. La colonna di destra è un punto di partenza, non una legge:
| Passaggio dell'agente | Cosa richiede davvero | Dove cade di solito |
|---|---|---|
| Classificare l'input e instradare | Costanza e velocità su un insieme chiuso di categorie | Modello piccolo |
| Estrarre campi da un documento | Formato stabile; l'errore si scopre con la validazione | Modello piccolo con contratto di output |
| Cercare e riassumere nei tuoi documenti | Fedeltà alla fonte; comanda la qualità del recupero | Modello intermedio |
| Decidere su denaro, persone o dati regolamentati | Giudizio e sfumatura; l'errore si paga in euro o in reputazione | Modello più capace |
| Redigere ciò che leggerà un cliente | Tono, precisione e zero invenzione | Modello più capace |
L'unico che può confermare quella tabella è il tuo insieme di casi. Ci sono classificazioni con venti categorie sovrapposte in cui il modello piccolo affonda, e redazioni così circoscritte — una conferma di ricezione con tre variabili — che il piccolo è sovradimensionato. Per questo la distribuzione si decide misurando e si rivede quando cambia il catalogo dei modelli o cambia il tuo volume.
Una sfumatura che risparmia dispiaceri: il routing conviene solo quando le categorie sono davvero distinte e la classificazione si può fare con precisione. È la condizione che Anthropic pone a questo pattern, ed è quella che salta quando qualcuno infila un router dove non serviva. Se il classificatore sbaglia, non hai risparmiato: hai messo un nuovo punto di rottura davanti a tutto il resto, per giunta silenzioso, perché un input instradato male non dà errore — dà una risposta sicura di sé del tipo sbagliato.
L'ordine giusto: parti dal costoso e scendi finché non si vede
Chiarita la distribuzione, resta il come. La guida di OpenAI propone una ricetta che va contro l'istinto di tutti: costruire il prototipo con il modello più capace per ogni compito per fissare una linea di base di prestazione, e da lì provare a sostituirlo con modelli più piccoli per vedere se danno ancora un risultato accettabile. I suoi principi, in quest'ordine: predisporre valutazioni per fissare la linea di base, raggiungere l'obiettivo di accuratezza con i migliori modelli disponibili e solo dopo ottimizzare costo e latenza sostituendo i grandi con i piccoli dove si può. Fonte: A practical guide to building agents, OpenAI, consultato il 12 settembre 2026.
- Costruisci la batteria di casi prima di toccare l'agente. Trenta o cinquanta, reali, con la risposta corretta accanto. È il passaggio che saltano tutti ed è quello che decide se il resto serve a qualcosa.
- Costruisci l'agente intero con il modello più capace in ogni passaggio. Non stai ancora ottimizzando: stai scoprendo se il tuo obiettivo di accuratezza sia raggiungibile.
- Misura contro la batteria. Se qui non arrivi all'obiettivo, il problema non è il modello: è il prompt, i tuoi dati, il recupero o il compito — e scendere di modello lo nasconderebbe soltanto.
- Raggiunto l'obiettivo, scendi un gradino alla volta e ripassa la batteria. Un cambio, una misura. Due cambi insieme e non sai più quale fosse.
- Fermati al gradino prima di quello che rompe. E scrivi quale passaggio usa quale modello e con quale accuratezza misurata, perché fra tre mesi non se lo ricorderà nessuno.
Il motivo per non fare il contrario è diagnostico, non dogmatico. Se parti dal modello economico e l'agente non funziona, hai quattro sospettati e nessun modo di separarli: può essere il modello, il prompt, i tuoi dati o un compito mai definito bene. Partendo dall'alto, quando qualcosa si rompe mentre scendi sai esattamente cosa l'ha rotto, perché hai cambiato una cosa sola.
Il livello che ti permette di cambiare modello senza toccare l'agente
Tutto quanto sopra ha una data di scadenza. Il catalogo dei modelli ruota ogni pochi mesi, i prezzi si muovono e i fornitori deprecano versioni. Se la decisione di oggi è scritta dentro l'agente — il nome del modello ripetuto in sette punti del codice —, fra sei mesi non potrai rifarla, e finirai con il problema che descriviamo in come cambiare modello senza rompere le tue automazioni: il flusso non si rompe con un errore, si rompe con un altro formato e un altro tono, in silenzio.
Il livello che lo evita sono cinque pezzi, e nessuno è sofisticato:
- Una sola funzione che chiama il modello. Tutte le chiamate passano di lì. Se ci sono sette punti nel codice con dentro il nome di un modello, hai già debito.
- L'identificativo del modello, in configurazione. Un file con il modello di ogni passaggio. Cambiare modello dev'essere cambiare una riga, non aprire l'agente.
- Un contratto di output validato. Prima che il risultato tocchi qualsiasi sistema, si verifica che abbia la forma pattuita. È ciò che trasforma un cambio di formato silenzioso in un errore visibile.
- La batteria di casi, eseguibile con un comando. Se provare un modello nuovo costa mezza mattinata di lavoro manuale, non lo proverà nessuno.
- Un registro di quale modello ha gestito quale caso. Senza, non puoi confrontare il prima e il dopo di un cambio, né spiegare perché la settimana scorsa andava meglio.
Non è un'ottimizzazione facoltativa da rimandare alla fase due. È la differenza tra scegliere un modello oggi e poter riscegliere fra sei mesi. Quando quel livello non esiste, la decisione sul modello si prende una volta e si eredita per sempre: esattamente la forma sbagliata per un sistema che vive in un mercato che si muove ogni trimestre.
La tabella di distribuzione: una pagina, con un responsabile e una data
La chiusura è la stessa di le istruzioni di un agente di IA: se la decisione non è scritta, non esiste. Basta una pagina, e deve rispondere a queste cinque cose.
- Quale modello usa ogni passaggio, con una riga di perché e l'accuratezza misurata contro la batteria il giorno in cui si è deciso.
- Cosa è stato provato e scartato. Il candidato che non è entrato e il motivo. Senza questo, qualcuno lo riproverà da zero fra quattro mesi.
- Chi firma. Una persona con nome e cognome. Una tabella senza responsabile non si rivede mai.
- Cosa fa scattare una revisione: la comparsa di un modello nuovo rilevante, la deprecazione da parte del fornitore di quello che usi, un volume che cambia di ordine di grandezza, o un'accuratezza misurata che cala.
- Prossima revisione. Una data, anche se non è successo nulla. La decisione scade da sola e nessuno avvisa.
Se il tuo agente è già in produzione e questa pagina non esiste, comincia dai passaggi che toccano denaro: quale modello decide un rimborso, quale modello redige ciò che legge il tuo cliente, e con quale accuratezza misurata. Il resto può aspettare una settimana.
Noi montiamo quel livello prima dell'agente: chiamata isolata, modello in configurazione, contratto di output e batteria di casi eseguibile, come parte dell'infrastruttura di IA per l'impresa su cui poi si costruiscono gli impiegati IA. È la parte che nessuno mostra in una demo e l'unica che decide se fra un anno cambi modello in un pomeriggio o rifai il sistema. La logica completa è in creare un agente di IA che regga la produzione.