Un martes por la tarde, el agente de atención le dice a un cliente que puede devolver un pedido personalizado fuera de plazo. No puede: esa política no existe. Lo descubre alguien del equipo al leer la conversación y la reacción es casi universal: abrir los registros y averiguar por qué lo dijo. Es el movimiento más natural y el que más daño prolonga.
La tesis en una línea: cuando un agente de IA se equivoca con un cliente, el orden correcto es contener, acotar el alcance, avisar y solo después diagnosticar. Casi todo el mundo empieza por el final, y mientras diagnostica, el agente sigue contestando.
Qué hacer cuando falla un agente de IA: contener antes de diagnosticar
Diagnosticar lleva horas; contener lleva minutos. Mientras buscas la causa, el agente sigue en producción con la misma instrucción, los mismos datos y las mismas herramientas que produjeron el error, así que cada conversación nueva es otra oportunidad de repetirlo. Contener no es arreglar: es reducir lo que el agente puede hacer hasta que sepas qué ha pasado. Y tiene que ser reversible, porque lo vas a hacer con prisa y sin diagnóstico.
Las opciones, de menos a más drástica:
- Bajarle la autonomía. Pasarlo a modo «propone, una persona envía». Mantiene el servicio y corta el daño nuevo. Solo es posible si tienes definida de antemano una escala de niveles de autonomía de un agente.
- Quitarle la herramienta que causó el daño. Si prometió un reembolso, se le retira el permiso de reembolsar; si escribió en el CRM, se deja en solo lectura. Es el uso práctico de haber pensado bien los permisos de un agente de IA.
- Derivar a una persona los temas afectados, con un mensaje fijo y honesto: «Te atiende una persona del equipo».
- Apagarlo del todo. Último recurso, pero legítimo. Exige un interruptor con nombre y alguien autorizado a pulsarlo sin pedir permiso a tres personas.
La regla: pulsa el botón más pequeño que corte el daño. Un agente apagado también es un incidente, solo que visible.
Cuántos clientes más recibieron la misma respuesta mala
Es la pregunta que casi nadie tiene preparada y la que decide la gravedad real. Un error aislado y un patrón no se gestionan igual, y desde la conversación de un solo cliente es imposible saber cuál tienes. Acotar el alcance es responder con datos tres cosas:
- Cuántos estuvieron expuestos: conversaciones en las que el agente dijo lo mismo o algo equivalente, desde la primera vez que pudo ocurrir hasta el momento de la contención.
- Cuántos actuaron sobre ello: los que pidieron la devolución, aceptaron un plazo o tomaron una decisión basándose en esa respuesta.
- Cuántos tienen un compromiso con dinero o con plazo: los únicos que exigen una respuesta individual hoy.
Eso solo se puede hacer si las conversaciones se guardan y se pueden buscar. La retención del registro suele decidirse por coste de almacenamiento o por privacidad, sin pensar en este momento; conviene decidirla sabiendo que es lo que te permite contar a los afectados, como se explica en cuánto tiene que durar el log de tu agente. Un buen criterio de partida: la ventana a revisar empieza en el último cambio del agente (instrucción, fuente de datos o modelo), no en la primera queja.
Avisar: a quién, cuándo y con qué mensaje
Avisar va antes del diagnóstico porque el cliente afectado se entera igual, y es mejor que se entere por ti. No hace falta conocer la causa para decir lo importante: qué ocurrió, qué es válido y qué no, y qué vas a hacer. Tres destinatarios, tres momentos:
| A quién | Cuándo | Qué le dices |
|---|---|---|
| Quien decide en la empresa (dirección o responsable del servicio) | En cuanto confirmas que hay un error con impacto | Qué dijo el agente, desde cuándo, a cuántos y qué has contenido |
| Clientes con un compromiso de dinero o de plazo | Cuanto antes, de forma individual, una vez acotado el alcance | Que la información era incorrecta, cuál es la correcta y cómo se resuelve |
| El resto de expuestos | Solo si actuaron sobre la respuesta o el tema es sensible | Una corrección breve, sin dramatismo |
Dos cosas que no funcionan: esperar a la causa raíz para escribir al cliente y mandarle un comunicado sobre «una incidencia técnica». Dile qué le dijo el agente y qué es lo correcto. Cumplir o no lo que el agente prometió por error es una decisión de negocio que se toma de forma consciente y con quien corresponda; lo que no puede pasar es que la tome el agente por defecto.
¿Hay que avisar si el error afectó a un solo cliente?
Sí, a ese cliente y a quien decide en la empresa. Lo que cambia es el resto: con un caso aislado y confirmado como tal tras acotar el alcance, basta una corrección individual. Pero «aislado» es una conclusión que se demuestra con la búsqueda anterior, no una suposición con la que se empieza.
Solo después: diagnosticar sin reabrir el problema
Con el daño frenado y los afectados identificados, el diagnóstico deja de correr contra el reloj. Busca la causa en este orden, de más a menos barato: la instrucción (¿decía algo ambiguo o contradictorio?), la fuente de información (¿un documento desactualizado, una página que cambió?), la herramienta (¿devolvió un dato erróneo?) y, al final, el modelo. Casi nunca es el modelo, y es la hipótesis a la que se salta primero.
Queda un riesgo: arreglar y reactivar el mismo día. La corrección es un cambio más y necesita probarse antes de tocar producción, con la conversación que falló como primera prueba. Después se devuelve la autonomía por escalones, no de golpe.
Las dos primeras horas, resumidas
| Tramo | Qué haces | Qué no haces |
|---|---|---|
| Minutos 0-15 | Contener: bajar autonomía, quitar la herramienta o derivar a una persona | Buscar la causa |
| Minutos 15-60 | Acotar: contar expuestos, afectados y compromisos con dinero | Dar por hecho que fue un caso aislado |
| Minutos 60-90 | Avisar: primero a quien decide, después a los clientes con compromiso | Esperar a la causa raíz para comunicar |
| Minutos 90-120 | Empezar a diagnosticar con el daño frenado | Reactivar sin probar la corrección |
Lo que tiene que estar listo antes de que pase
Dos horas solo son posibles si las piezas existían antes: un interruptor con nombre y alguien autorizado a usarlo, un registro de conversaciones consultable, una lista de a quién avisar y un borrador de mensaje. Si es la primera vez que lo piensas a las seis de la tarde, serán más de dos horas. La guardia, las severidades y el runbook de una página que lo ordenan están en quién responde cuando se cae una automatización, y si prefieres no montarlo ni sostenerlo tú, es lo que hacemos con la gestión de incidencias de agentes de IA.
La frase para llevarse: que un agente se equivoque es normal; que siga equivocándose mientras tú averiguas por qué, no.