La tesi in una frase: il modello è la parte facile. Ciò che decide se il tuo progetto di IA arriva in produzione o resta bloccato in una demo non è quale modello scegli, ma lo stato dei tuoi dati il giorno in cui li colleghi. Il dato disordinato —sparso, riempito a metà, senza proprietario— è il vero freno, ed è anche la parte di cui nessuno parla alla chiamata di vendita perché non fa bella figura in una demo. Questo articolo parla di questo, con fonti e senza fumo.
La qualità dei dati per l’IA nella tua azienda è l’80% del lavoro (e quasi nessuno te lo dice)
Non è l’opinione di un venditore: è ciò che ripete chi costruisce davvero IA. Andrew Ng, uno dei nomi che hanno fondato il machine learning applicato, l’ha detto senza giri: «se l’80% del nostro lavoro è la preparazione dei dati, allora garantire la qualità del dato è il compito più critico di un team di machine learning». E non è un caso isolato: secondo l’Institute for Business Value di IBM, i data scientist dedicano tra il 60% e l’80% del tempo di un progetto a preparare il dato —acquisirlo, pulirlo, etichettarlo, ordinarlo— e non a scegliere o addestrare il modello. Il modello si prende il titolo; il dato si prende le ore.
La conseguenza pratica è scomoda: quando un progetto di IA fallisce, non è quasi mai perché il modello era debole. È perché il dato che gli hai dato entrava a metà, si contraddiceva tra sistemi o nessuno sapeva nemmeno dove vivesse. L’algoritmo ha fatto il suo lavoro con spazzatura, e ha restituito spazzatura con molta sicurezza.
Cosa significa «dati disordinati» in pratica
Non è un problema astratto di «governance». È una lista di cose concrete che quasi ogni azienda riconosce appena le legge:
- Non sai quali dati hai. Sono sparsi tra il CRM, tre fogli di calcolo, la posta di qualcuno e una cartella condivisa che nessuno pulisce dal 2021.
- Gli stessi dati si contraddicono. Il cliente compare con un nome nella fatturazione, un altro nel CRM e un terzo nello strumento di supporto. Per una persona è «ovviamente lo stesso»; per un modello sono tre entità distinte.
- Entrano a metà. Campi vuoti, categorie non compilate, date in cinque formati. Qualsiasi automazione che costruisci sopra eredita quei buchi.
- Nessuno li tocca con criterio. Non c’è un proprietario del dato: chi lo inserisce lo inserisce come può, e nessuno decide qual è la fonte di verità quando due sistemi discordano.
Ciascuno di questi punti è una crepa da cui cade un progetto di IA. E nessuno si risolve con un modello migliore: si risolvono ordinando il dato prima di chiedere alla macchina qualsiasi cosa.
Perché il modello è la parte facile
I buoni modelli oggi sono una commodity: i migliori sono a una chiamata API di distanza e migliorano da soli ogni pochi mesi senza che tu faccia nulla. Ciò che è scarso —e ciò che davvero separa un progetto che funziona da uno che non funziona— è avere il dato pulito, mappato e con un proprietario per alimentarli. Per questo il vero lavoro di un progetto di IA somiglia più all’idraulica che alla scienza: sapere da dove esce ogni dato, come si connette, dove si sporca e chi lo ripara.
Questo ha una lettura ottimista. Se il collo di bottiglia fosse il modello, saresti in balìa di un fornitore. Poiché il collo di bottiglia è il tuo dato, la soluzione è in mano tua —e si accumula—: ogni volta che ordini una fonte, tutti i progetti che vengono dopo escono più economici e più affidabili. Il dato ordinato è infrastruttura, e l’infrastruttura si paga una volta e rende molte.
Cosa fare prima di scegliere un modello
L’ordine giusto ribalta ciò che fanno quasi tutti. Prima il dato, poi il modello. In concreto, prima di accendere qualcosa:
| Passo | Cosa risolve |
|---|---|
| Mappare quali dati hai e dove vivono | Basta «dati là in giro»: sai cosa c’è, in quale sistema e in che stato |
| Decidere la fonte di verità | Quando due sistemi discordano, c’è una regola, non una discussione |
| Pulire e unificare le entità | Lo stesso cliente è un cliente, non tre; l’IA smette di contare male |
| Dare al dato un proprietario e un processo | Il dato entra pulito alla fonte e non si risporca il mese dopo |
Questo lavoro è la parte noiosa —il governo del dato— ed è proprio quella che decide il risultato. Se vuoi montarlo bene, lo trattiamo per quello che è, infrastruttura, nel servizio di governo del dato: sapere quali dati hai, dove vivono e chi li tocca, e lo lasciamo pronto perché ci giri sopra vera IA con l’infrastruttura di IA per l’azienda. Solo quando il dato è in ordine ha senso automatizzare l’azienda con l’IA o addestrare un agente su di esso: fallo prima, e automatizzi il disordine.
Se stai guardando un progetto di IA e nessuno ti ha ancora chiesto lo stato dei tuoi dati, quello è l’allarme. Ordina il dato prima —o fattelo ordinare— e poi scegli il modello. L’IA non si presenta in una demo con dati finti. Si implementa sul dato reale, ed è l’80% di cui nessuno ti parla.