Saltar para o conteúdo
Se não funciona, não pagas. 30 dias.
Implementa.
Infraestrutura··5 min

Evals: como avaliar um sistema de IA na empresa (sem medir, não sabes se funciona)

Como avaliar um sistema de IA na empresa não é olhar para ele um bocado e dizer « está a correr bem »: isso é fé, não uma métrica. Sem um conjunto de avaliação —os evals— não sabes se acerta, só parece. Aqui, sem teatro: o que é um eval, o que medir e porque é o que separa um sistema em produção de uma experiência com sorte.

Senior AI Infrastructure Implementer

AI Infrastructure Pod

« Funciona muito bem. » É a frase mais dita sobre um sistema de IA e a menos defensável. Alguém o experimentou um bocado, fez-lhe cinco perguntas, saíram bem, e daí a « funciona » há um salto de fé que em produção se paga caro. Como avaliar um sistema de IA na empresa não é essa impressão: é medir, contra uma base, se acerta —e quanto se engana quando o faz.

A tese numa frase: sem um conjunto de avaliação —o que no ofício se chama evals— não sabes se a tua IA funciona, só parece. « Parece que corre bem » não é uma métrica; é uma anedota com sorte. O que separa um sistema que podes pôr à frente de um cliente de uma experiência que reza para não falhar é, quase sempre, se há evals ou não.

Como avaliar um sistema de IA na empresa: porque « parece que corre bem » não é uma métrica

Avaliar um sistema de IA na empresa é comparar o que responde com o que deveria responder, sobre um conjunto de casos representativos, e tirar um número. Em concreto: reúnes um conjunto de entradas reais —as perguntas, documentos ou tarefas que de facto lhe chegam—, defines qual é a resposta correta ou o critério de acerto para cada uma, e executas esse conjunto sempre que mudas algo —o prompt, o modelo, os dados. O resultado é uma pontuação que se mexe: sobe quando melhoras, desce quando partes algo sem dar por isso. Sem esse número, cada mudança é às cegas e cada « funciona » é uma opinião.

O que é um eval (e em que se diferencia de « experimentá-lo um bocado »)

Experimentar um sistema à mão é útil no primeiro dia e enganador no segundo. Um eval é o contrário dessa prova informal em três coisas:

  • É representativo, não anedótico. Não são as cinco perguntas que te ocorrem; são dezenas ou centenas de casos reais, incluindo os estranhos e os que já falharam uma vez.
  • É repetível, não de uma vez. Executa-se igual em cada mudança, por isso compara maçãs com maçãs: sabes se a versão de hoje é melhor ou pior do que a de ontem, não se « te deu boa sensação ».
  • Dá um número, não uma impressão. Uma taxa de acerto, uma taxa de erro, uma de alucinação. Algo que podes pôr num gráfico e vigiar todas as semanas.

A diferença entre um sistema sério e uma demo bonita está, quase sempre, em se esse número existe. O como técnico de o montar —o conjunto, os critérios, o ciclo— desdobramo-lo no guia sobre como treinar um agente de IA: dados, evals e governance; aqui o que importa é porque sem ele estás às cegas.

O que medir: as quatro coisas que separam produção de fé

Não é preciso medir tudo desde o primeiro minuto. Com quatro métricas sabes mais do teu sistema do que a maioria dos projetos que andam há meses:

  1. Taxa de acerto. Dos casos do conjunto, em quantos responde bem segundo o teu critério. É a métrica mãe; se não a tens, não tens nada.
  2. Taxa de erro e de alucinação. Quanto acerta não chega: importa quanto se engana com aplomb. Um sistema que acerta 90% mas inventa os outros 10% com total segurança pode ser pior do que um mais humilde.
  3. Cobertura de casos limite. Que percentagem dos casos estranhos —os que partem os sistemas fracos— passam pelo eval. O que não está no conjunto não se mede, e o que não se mede degrada-se em silêncio.
  4. Deriva no tempo. O mesmo eval, executado todas as semanas. Um sistema de IA não fica quieto: muda a entrada, degradam-se os prompts, o fornecedor atualiza o modelo. A deriva vê-se no gráfico antes de se ver na queixa do cliente.

O erro de não ter evals desde o primeiro dia

A falha mais cara não é ter maus evals: é não ter nenhum. Um sistema sem medição não falha no dia do lançamento —falha devagar, e ninguém dá por isso até o erro chegar ao cliente. Sem um número base não podes provar que melhora, não podes defender o gasto perante a direção, e não podes distinguir uma mudança que ajuda de uma que parte. É, de facto, uma das causas com nome pelas quais falham os projetos de automação com IA: zero medição, zero forma de saber se o projeto continua vivo ou é um zombie que ninguém se atreve a desligar.

Evals não é um projeto, é um hábito

A armadilha é tratar os evals como uma fase (« montamos no fim »). No fim é tarde: o sistema já está em produção a tomar decisões que não podes auditar. O barato e o sensato é ao contrário —começar com um conjunto pequeno no primeiro dia e fazê-lo crescer com cada caso estranho que aparece. Não é um entregável que se assina e se esquece; é a rotina que mantém o sistema honesto.

Medir bem não é glamoroso, mas é a única coisa que transforma « achamos que funciona » em « sabemos que funciona ». Se vais pôr IA a trabalhar na tua empresa e queres que aguente, isto é alicerce, não adorno —e é exatamente o que montamos na infraestrutura de IA empresarial: o sistema, os seus evals e o ciclo que o mantém medido no tempo. Não te deixamos uma IA que parece que funciona; deixamos-te uma que podes provar que funciona —ou de que sabes exatamente onde falha.

Deixamos isto a funcionar?

Se isto te ressoou, conversa de 30 minutos sem compromisso. Dizemos-te o que encaixa, o que não e o preço aproximado.

Ver casos
Evals: como avaliar um sistema de IA na empresa (sem medir, não sabes se funciona) · Implementa