Saltar al contenido
Implementa.
AutomatizaciónAgentes IA··6 min

Por qué empeora un agente de IA con el tiempo si nadie ha cambiado nada: ha cambiado lo que le llega

Por qué empeora un agente de IA con el tiempo cuando el código, el prompt y el modelo siguen idénticos: porque se validó contra las entradas de enero y la realidad se movió. La deriva de la entrada, distinta de la del modelo, y cómo detectarla antes de que la detecte el cliente.

Senior AI Operations Implementer

AI Operations Pod

Un piloto de clasificación de solicitudes de clientes se valida en enero. Funciona: casos reales, revisión humana, visto bueno del comité y a producción. En junio empiezan las quejas: derivaciones al departamento equivocado, respuestas que no vienen a cuento. El equipo hace lo razonable y revisa el prompt, el modelo y la configuración. Todo está exactamente como en enero. «Nadie ha cambiado nada», concluyen, y la conversación se desliza hacia «la IA es poco fiable».

La tesis en una línea: cuando un agente empeora sin que nadie toque el código, lo que ha cambiado son sus entradas, y la prueba de enero solo demostró que funcionaba para la gente, los formularios y el calendario de enero. «Nadie ha cambiado nada» no es la defensa del sistema; es el diagnóstico.

Por qué empeora un agente de IA con el tiempo si el código es el mismo

Porque un agente no es un programa que haga siempre lo mismo: es una función de lo que recibe, y lo que recibe cambia. Una validación mide el comportamiento sobre una muestra concreta de entradas. Si la realidad se desplaza de esa muestra, el número que viste en la prueba no viaja con ella. Es la misma razón por la que un porcentaje de acierto no basta en producción: la precisión no es una propiedad del modelo, es una propiedad del sistema más sus datos, y los datos se mueven.

Las cuatro formas en que cambian las entradas sin avisar

  • El calendario. Campañas, cierres de trimestre, temporada alta, el mes de vacaciones. El agente validado con el tráfico de un mes tranquilo se encuentra en otro mes con otro tipo de petición, más urgente y más ambigua.
  • Gente nueva que escribe distinto. Un canal nuevo, un cliente de otro país, un segmento que antes no llegaba. Mensajes más largos, otro idioma mezclado, otras abreviaturas. La muestra de la prueba no los contenía.
  • Un sistema aguas arriba que cambia. Un formulario que añade un campo opcional, un CRM que cambia el formato de una fecha, un proveedor que renombra una columna. Nadie avisa al agente porque nadie sabe que existe esa dependencia.
  • El negocio cambia y el prompt no. Producto nuevo, precios nuevos, una política de devoluciones distinta. Las instrucciones siguen describiendo la empresa de enero.

Deriva de la entrada y deriva del modelo no se arreglan igual

Conviene no mezclarlas, porque la primera pregunta de un diagnóstico es cuál de las dos tienes. La deriva del modelo viene del proveedor: actualiza o retira una versión y el mismo prompt se comporta distinto. Se contiene con la versión fijada y una batería de casos que se ejecuta ante cada cambio, y la desarrollamos en la guía de cómo cambiar de modelo sin romper tus automatizaciones.

La deriva de la entrada ocurre aunque lo fijes todo. Puedes congelar el modelo, el prompt y la infraestructura durante un año: si el mundo que le llega cambia, el agente empeora igual. Por eso la reacción habitual, probar otro modelo, suele ser un error, como explicamos en cambiar de modelo no arregla tu proceso: mueves el problema de sitio y encima pagas una migración.

Una pregunta de un minuto separa los dos casos: ¿ha cambiado el sistema o ha cambiado lo que entra en él? Si el modelo, el prompt y las integraciones están como antes y el rendimiento cae, empieza por las entradas.

Cómo detectar la deriva de la entrada antes de que la detecte el cliente

La señal que llega por la vía de las quejas llega tarde: para entonces llevas semanas de errores. Las cuatro comprobaciones que la adelantan son baratas, pero tienen que existir antes de necesitarlas:

  1. Guarda la foto de la validación. La muestra de entradas con la que se aprobó el agente es tu referencia. Si no la conservas, no hay con qué comparar.
  2. Compara cada semana lo que entra con esa foto. No hace falta estadística sofisticada: longitud de los mensajes, idioma, reparto por categoría, campos vacíos, porcentaje de casos que el agente nunca había visto. Un cambio brusco en cualquiera de ellos es la alarma.
  3. Vigila las excepciones por tipo de entrada. La tasa de casos que el agente deriva a una persona, o que una persona corrige, sube antes que las quejas, y desglosada por tipo te dice dónde se está moviendo la realidad.
  4. Reejecuta las evaluaciones con casos recientes. Una batería fija de enero solo te cuenta lo que ya sabías. Añade cada mes casos reales nuevos, etiquetados por una persona, como se explica en evaluaciones para saber si tu IA funciona de verdad.

El primer paso, además, solo existe si tomaste la línea base. Es el mismo principio de medir el rendimiento de tus automatizaciones: el número que no tomaste antes no se puede tomar después.

Qué hacer cuando la entrada ya se ha movido

Hay tres respuestas, y la elección depende de cuánto se haya movido y de lo que cueste el error:

  • Actualizar la referencia. Incorporar los casos nuevos a la validación y reajustar instrucciones y ejemplos. Es la respuesta cuando el cambio es estable y el agente puede aprender a cubrirlo.
  • Ampliar el alcance con una ruta propia. Si ha aparecido un tipo de entrada nuevo y distinto (otro idioma, otro canal), trátalo como un caso nuevo con su propia validación, no como una variante del anterior.
  • Reducir la autonomía mientras tanto. Lo que el agente ya no reconoce se deriva a una persona, y el agente pasa de decidir a proponer. Es el mecanismo de los niveles de autonomía de un agente: bajar un escalón es una decisión reversible; apagarlo no siempre.

Nada de esto funciona sin dueño. La deriva de la entrada no la detecta nadie en particular porque no es el trabajo de nadie en particular: ni de quien construyó el agente, que ya está en otro proyecto, ni de quien lo usa. Hace falta una persona con nombre, una cadencia (semanal, para empezar) y autoridad para cambiar el agente cuando el dato lo pide. El resto del plan está en la guía de mantenimiento de las automatizaciones de IA. Y si prefieres no montarlo ni sostenerlo tú, es lo que hacemos al monitorizar la IA en producción: instrumentar las entradas, las excepciones y los casos de referencia, y actuar cuando se mueven.

Cómo saber si te está pasando ahora

  • Nadie puede enseñarte la muestra de entradas con la que se aprobó el agente.
  • La última vez que se añadieron casos nuevos a la validación fue antes del lanzamiento.
  • Las excepciones se cuentan en total, no por tipo de entrada.
  • Si preguntas quién mira todo esto, la respuesta es «el equipo», no una persona.

Si dos de las cuatro son ciertas, probablemente tu agente ya se ha movido y solo te falta el instrumento para verlo.

La frase para llevarse: un agente no empeora porque envejezca, empeora porque el mundo sigue cambiando y nadie volvió a comprobar que seguían hablando el mismo idioma.

¿Lo dejamos funcionando?

Si esto te ha resonado, conversación de 30 minutos sin compromiso. Te decimos qué encaja, qué no y a qué precio aproximado.

Ver casos
Por qué empeora un agente de IA con el tiempo si nadie ha cambiado nada: ha cambiado lo que le llega · Implementa