Saltar para o conteúdo
Se não funciona, não pagas. 30 dias.
Implementa.
Infraestrutura··5 min

Dados desarrumados: o verdadeiro travão do teu projeto de IA

A qualidade dos dados para IA numa empresa decide o projeto antes de escolheres modelo: 80% do trabalho é o dado, não o algoritmo. Sem saber que dados tens, onde vivem e quem lhes toca, nenhuma IA vale grande coisa. O modelo é a parte fácil; o dado desarrumado é o que enterra os pilotos. Aqui o porquê, com fontes, e o que fazer antes de ligar seja o que for.

Senior AI Infrastructure Implementer

AI Infrastructure Pod

A tese numa frase: o modelo é a parte fácil. O que decide se o teu projeto de IA chega a produção ou fica preso numa demo não é que modelo escolhes, é o estado dos teus dados no dia em que os ligas. O dado desarrumado —disperso, meio preenchido, sem dono— é o verdadeiro travão, e é também a parte de que ninguém fala na chamada de vendas porque não fica bem numa demo. Este artigo é sobre isso, com fontes e sem fumo.

A qualidade dos dados para IA na tua empresa é 80% do trabalho (e quase ninguém to diz)

Não é opinião de vendedor: é o que repete quem constrói IA a sério. Andrew Ng, um dos nomes que fundaram o machine learning aplicado, disse-o sem rodeios: «se 80% do nosso trabalho é preparação de dados, então garantir a qualidade do dado é a tarefa mais crítica de uma equipa de machine learning». E não é um caso isolado: segundo o Institute for Business Value da IBM, os cientistas de dados dedicam entre 60% e 80% do tempo de um projeto a preparar o dado —adquiri-lo, limpá-lo, etiquetá-lo, arrumá-lo— e não a escolher ou treinar o modelo. O modelo leva o título; o dado leva as horas.

A consequência prática é incómoda: quando um projeto de IA falha, quase nunca é porque o modelo era fraco. É porque o dado que lhe deste entrava a meio, contradizia-se entre sistemas ou nem sequer alguém sabia onde vivia. O algoritmo fez o seu trabalho com lixo, e devolveu lixo com muita confiança.

O que significa «dados desarrumados» na prática

Não é um problema abstrato de «governação». É uma lista de coisas concretas que quase qualquer empresa reconhece assim que as lê:

  • Não sabes que dados tens. Estão repartidos entre o CRM, três folhas de cálculo, o email de alguém e uma pasta partilhada que ninguém limpa desde 2021.
  • Os mesmos dados contradizem-se. O cliente figura com um nome na faturação, outro no CRM e um terceiro na ferramenta de suporte. Para uma pessoa é «obviamente o mesmo»; para um modelo são três entidades distintas.
  • Entram a meio. Campos vazios, categorias por preencher, datas em cinco formatos. Qualquer automação que construas por cima herda esses buracos.
  • Ninguém lhes toca com critério. Não há dono do dado: quem o mete mete-o como pode, e ninguém decide qual é a fonte de verdade quando dois sistemas discordam.

Cada um destes pontos é uma fenda por onde cai um projeto de IA. E nenhum se resolve com um modelo melhor: resolvem-se a arrumar o dado antes de pedir seja o que for à máquina.

Porque o modelo é a parte fácil

Os bons modelos são hoje uma commodity: os melhores estão a uma chamada de API de distância e melhoram sozinhos a cada poucos meses sem que faças nada. O escasso —e o que de facto separa um projeto que funciona de um que não funciona— é ter o dado limpo, mapeado e com dono para os alimentar. Por isso o verdadeiro trabalho de um projeto de IA parece-se mais com canalização do que com ciência: saber de onde sai cada dado, como se liga, onde se suja e quem o repara.

Isto tem uma leitura otimista. Se o estrangulamento fosse o modelo, estarias à mercê de um fornecedor. Como o estrangulamento é o teu dado, a solução está do teu lado —e é acumulativa—: cada vez que arrumas uma fonte, todos os projetos que vêm depois saem mais baratos e mais fiáveis. O dado arrumado é infraestrutura, e a infraestrutura paga-se uma vez e rende muitas.

O que fazer antes de escolher modelo

A ordem certa inverte o que quase toda a gente faz. Primeiro o dado, depois o modelo. Em concreto, antes de ligar seja o que for:

PassoO que resolve
Mapear que dados tens e onde vivemDeixa de haver «dados por aí»: sabes o que há, em que sistema e em que estado
Decidir a fonte de verdadeQuando dois sistemas discordam, há uma regra, não uma discussão
Limpar e unificar entidadesO mesmo cliente é um cliente, não três; a IA deixa de contar mal
Pôr dono e processo ao dadoO dado entra bem na origem e não volta a sujar-se no mês seguinte

Este trabalho é a parte aborrecida —o governo do dado— e é justamente a que decide o resultado. Se o queres montar bem, tratamo-lo pelo que é, infraestrutura, no serviço de governo do dado: saber que dados tens, onde vivem e quem lhes toca, e deixamo-lo pronto para que corra IA a sério por cima com a infraestrutura de IA para empresa. Só quando o dado está em ordem faz sentido automatizar o negócio com IA ou treinar um agente sobre ele: fá-lo antes, e automatizas a desordem.

Se estás a olhar para um projeto de IA e ninguém te perguntou ainda pelo estado dos teus dados, esse é o sinal de alarme. Arruma o dado primeiro —ou manda-o arrumar— e depois escolhe o modelo. A IA não se apresenta numa demo com dados de mentira. Implementa-se sobre o dado real, e esse é o 80% que ninguém te conta.

Deixamos isto a funcionar?

Se isto te ressoou, conversa de 30 minutos sem compromisso. Dizemos-te o que encaixa, o que não e o preço aproximado.

Ver casos
Dados desarrumados: o verdadeiro travão do teu projeto de IA · Implementa