Aller au contenu
Implementa.

Créer un agent IA · Guide 11 sur 11

La mémoire d'un agent IA : ce que c'est, pourquoi ce n'est pas du RAG et quand il faut le faire oublier

Tu lui as chargé le manuel entier et l'agent continue de demander ce que tu lui as dit hier. La conclusion — « il lui manque de la mémoire » — est correcte et ne sert à rien, parce que mémoire est le mot avec lequel le marché désigne trois choses différentes : le contexte de la conversation en cours, la connaissance consultable (ça, c'est le RAG) et les faits qu'il doit retenir sur un client d'une session à l'autre. Ce guide les sépare, dit où vit chacune et ce qu'elle coûte vraiment, et entre dans la partie que presque personne n'écrit : quand il faut le faire oublier, pourquoi l'effacement n'est pas un bouton et quel tableau tu dois avoir écrit avant la première ligne de code.

Pourquoi ton agent « ne se souvient de rien » alors que toute la documentation est chargée

C'est la plainte numéro un de la deuxième semaine : tu lui as chargé le manuel entier, les politiques, l'historique des tickets, et l'agent continue de demander des choses que tu lui as déjà dites hier. La conclusion immédiate — « il lui manque de la mémoire » — est correcte et ne sert à rien, parce que mémoire est le mot avec lequel le marché désigne trois choses différentes, qui se rangent à des endroits différents, coûtent des choses différentes et cassent de manières différentes.

La confusion la plus chère du secteur, c'est celle-ci : mémoire et RAG ne sont pas la même chose. Le RAG, c'est que l'agent sache chercher dans ta documentation. La mémoire, c'est que l'agent sache qui tu es la prochaine fois que tu lui parles. Tu peux avoir un RAG impeccable — il récupère le paragraphe exact du manuel en 200 millisecondes — et un agent qui ne se souvient toujours pas que ce client s'est déjà plaint deux fois de la même commande. Ce sont des problèmes différents avec des solutions différentes, et monter le second avec l'outil du premier, c'est exactement pour ça que la moitié des projets s'enlisent ici.

Les trois choses que tu mets dans le même sac

Avant d'acheter quoi que ce soit, sépare. Un agent en production a normalement besoin des trois, mais elles se contractent, se paient et s'auditent séparément.

1. Le contexte de la conversation en cours (mémoire à court terme)

C'est ce que le modèle a sous les yeux en ce moment : ce que tu as dit dans ce fil. Ce n'est pas une base de données, c'est la fenêtre de contexte — l'espace de travail du modèle — et elle se vide quand la conversation se termine. C'est gratuit au sens où il n'y a rien à construire, et hors de prix au sens où ça se paie au token à chaque tour : plus le fil est long, plus chaque message suivant coûte cher. Quand quelqu'un te dit que son agent « se souvient de tout à l'intérieur de la conversation », il te décrit le comportement par défaut, pas une capacité qu'il aurait construite.

Le symptôme qu'il te manque ça : l'agent se contredit lui-même dans le même fil, ou il perd le fil dans les conversations longues. Ça se règle avec de la gestion de contexte (résumer les tours anciens), pas avec une base vectorielle.

2. La connaissance consultable (ça, c'est bien du RAG)

Tes documents, indexés de façon que l'agent puisse trouver le fragment pertinent et répondre avec lui sous les yeux. Manuels, politiques, contrats, procédures, catalogue, tickets résolus. C'est de la connaissance de l'organisation, la même pour tout le monde, et son problème n'est pas de se souvenir : c'est de trouver et d'être à jour. Ça vit dans un index — vectoriel, lexical ou les deux — et son coût principal n'est pas le stockage, c'est l'entretien : un index qui contient encore la procédure abrogée concurrence en silence celle qui est en vigueur.

Le symptôme qu'il te manque ça : l'agent répond avec aplomb des choses qui ne sont écrites nulle part, ou il cite le mauvais document. Ça se règle avec de la récupération, pas avec de la mémoire. Comment ça se monte et comment ça s'évalue, c'est dans entraîner un agent IA ; le garder vivant est un travail continu qui a son propre nom, maintenir à jour la connaissance de l'IA.

3. Les faits qu'il doit retenir d'une session à l'autre (mémoire à long terme)

Voilà la couche que presque personne ne construit, et c'est celle qui te manquait. Ce n'est pas de la documentation : ce sont des faits précis sur une personne, un compte ou un dossier, appris pendant le travail et qui doivent survivre à la fin de la conversation. « Ce client facture au nom d'une autre société. » « Ce fournisseur n'accepte pas les bons de livraison par mail. » « Cet utilisateur a déjà refusé cette proposition en mars, et il a dit pourquoi. »

Elle se distingue des deux autres par trois propriétés : elle est spécifique à une entité (elle ne vaut pas pour tout le monde), elle s'écrit toute seule pendant l'opération (personne ne charge un document avec ça dedans), et elle périme (une préférence change, une donnée cesse d'être vraie). C'est cette troisième propriété qui fait de la mémoire à long terme un problème de gouvernance et pas seulement d'ingénierie, et c'est le sujet de la seconde moitié de ce guide.

Où vit chacune et ce qu'elle coûte

CoucheOù elle vitQui l'écritCe qui la casseCoût dominant
Contexte de la conversationLa fenêtre de contexte du modèleLa conversation elle-mêmeFils longs : ça déborde ou ça devient cherTokens par tour
Connaissance consultable (RAG)Index sur tes documentsToi, au moment de publier le documentContenu obsolète et doublons non marquésEntretien de l'index
Mémoire à long termeEntrepôt dédié, hors du modèleL'agent, pendant l'opérationFaits périmés que personne ne retireGouvernance : revue et effacement

Regarde bien la colonne de droite, parce que c'est celle qui n'apparaît jamais dans le budget. Les deux premières couches ont un coût qui se voit sur une facture. La troisième a un coût qui se voit en réunion : quelqu'un doit décider ce qu'on retient, pendant combien de temps et qui peut l'effacer. Si ce quelqu'un n'existe pas, la mémoire à long terme n'est pas une capacité : c'est un passif qui grossit tout seul.

Le test de trente secondes pour savoir laquelle te manque

Prends le cas concret qui t'a fait penser qu'il te manquait de la mémoire et pose-lui trois questions. La réponse te dit quoi acheter, et t'évite de payer une base vectorielle pour réparer un résumé de conversation.

  1. La donnée qui te manque est-elle écrite dans un de tes documents ? Si oui, ce n'est pas de la mémoire : c'est de la récupération. Ton problème est dans l'index ou dans le document, pas dans l'agent.
  2. La donnée vaut-elle pour tous tes clients ou seulement pour celui-là ? Si elle vaut pour tous, c'est de la connaissance. Si elle est de ce client et de personne d'autre, c'est de la mémoire à long terme.
  3. La donnée cesserait-elle d'être vraie d'ici un an ? Si la réponse est oui, tu as besoin de la couche d'oubli avant d'avoir besoin de celle du souvenir. Stocker sans plan de péremption, c'est accumuler des erreurs futures avec une date d'activation.

Oublier est plus difficile que retenir

C'est la partie que presque personne n'écrit, et celle qui coûte le plus cher. Construire de la mémoire est un problème résolu : tu stockes le fait, tu le récupères au bon moment. Le retirer, en revanche, n'est pas une opération : c'en est plusieurs, et il suffit qu'une seule échoue pour que la donnée reste vivante.

Le meilleur exemple public de l'embrouillamini vient de la documentation d'OpenAI pour ChatGPT elle-même. Son centre d'aide dit littéralement que, pour effacer complètement quelque chose que ChatGPT pourrait savoir de toi, il faut supprimer « chaque source où cela apparaît, y compris les conversations passées, les conversations archivées, les fichiers, le résumé de mémoire », et déconnecter les applications connectées susceptibles de contenir cette information. Et il ajoute deux avertissements qui valent leur pesant d'or pour quiconque conçoit ça dans son entreprise : supprimer une conversation ne supprime pas les mémoires qui en sont sorties, et si tu désactives la mémoire puis la réactives, le système peut recréer des mémoires à partir des conversations encore présentes dans ton historique. Source : Memory FAQ, OpenAI Help Center, consulté le 10 septembre 2026.

Ce n'est pas un défaut d'OpenAI : c'est la forme du problème. Dès qu'un fait est copié à plus d'un endroit — l'entrepôt de mémoire, l'index, le journal de la conversation, le système de destination où l'agent a écrit — l'effacement cesse d'être un bouton et devient une procédure avec une liste d'endroits. Si personne n'a écrit cette liste, tu ne peux promettre d'effacer quoi que ce soit.

Ce qui t'oblige à pouvoir effacer (et ce que personne ne te dit)

Trois ancrages, et il vaut mieux ne pas les mélanger. Le premier : le droit à l'effacement du RGPD s'exerce sur les données personnelles que tu traites, et la mémoire d'un agent en contient par construction — noms, préférences, incidents, décisions. Le deuxième : le Comité européen de la protection des données, dans son avis 28/2024 (17 décembre 2024), place la barre haut pour considérer comme anonyme un modèle entraîné sur des données personnelles et rappelle que, face à un traitement illicite, les autorités peuvent ordonner des mesures correctrices allant jusqu'à l'effacement du jeu de données. Cet avis parle du modèle ; ton entrepôt de mémoire est un cas bien plus simple et bien plus clairement identifiable, donc ce qui là-bas est discutable, ici ne l'est pas.

Le troisième est le plus opérationnel et il vient de chez toi. En juillet 2026, la CNIL et le Conseil de l'IA et du Numérique ont publié une note exploratoire sur l'IA agentique et la protection des données qui met la mémoire persistante au centre du problème : elle décrit comment la multiplication des espaces de mémoire disperse les données entre environnements de stockage et rend plus complexe de déterminer ce qui est effectivement conservé, quelles opérations peuvent l'affecter et pendant combien de temps ; elle prend l'exemple de l'utilisateur qui supprime un fichier sensible et n'a aucun moyen de s'assurer qu'il a bien disparu de toute la mémoire du système ; et elle recommande, parmi les mesures à intégrer dès la conception, le cloisonnement de la mémoire des agents pour éviter l'accumulation de données. Cloisonner, ça veut dire que la mémoire d'un client ne fuit pas dans la conversation d'un autre, et qu'elle peut se désigner et se retirer par morceaux. C'est la différence entre un entrepôt étiqueté et un tiroir en vrac. Source : IA agentique et données personnelles, CNIL et CIANum, 20 juillet 2026.

Ce qu'aucun des trois ne te dit : combien de temps ton agent doit se souvenir que ce client préfère qu'on l'appelle l'après-midi. Ça n'est écrit dans aucun texte. C'est une politique à toi, et si tu ne l'écris pas, la politique par défaut est « pour toujours », qui est la pire de toutes.

La fiche d'une page : ce qu'il retient, où et jusqu'à quand

Tout ce qui précède tient dans un tableau qu'on revoit chaque trimestre. Il n'en faut pas plus, et sans lui il n'y a aucune conversation possible avec ton délégué à la protection des données.

Ce qui est retenuCouchePéremptionOù il faut l'effacerQui peut effacer
Préférence de contact du clientMémoire long terme24 mois sans activitéEntrepôt + copie dans le CRMResponsable du compte
Incident ouvert et son historiqueMémoire long termeClôture + rétention légaleEntrepôt + ticket + journalResponsable du support
Procédure interne en vigueurRAGÀ la publication de la nouvelle versionIndex (réindexer)Propriétaire du document
Résumé du fil en coursContexteFin de la conversationNe persiste pas
  1. Une ligne par type de donnée, pas par système. Si une ligne dit « données du client », elle est mal écrite : découpe-la jusqu'à ce que chaque ligne ait une péremption différente.
  2. La péremption, en unités. « Quand ça ne servira plus » n'est pas une péremption. « 24 mois sans activité », si, parce qu'un script peut l'appliquer.
  3. La colonne du où effacer est celle qui compte. C'est la liste d'endroits dont on parlait : si elle n'a qu'une seule entrée, elle est probablement incomplète.
  4. Un nom qui peut effacer. Une personne avec un vrai bouton, testé au moins une fois. Une procédure d'effacement que personne n'a jamais exécutée n'est pas une procédure.
  5. Revue trimestrielle avec le tableau sous les yeux. Ce qui s'accumule sans être revu cesse d'être de la mémoire et devient du sédiment.

Nous montons la couche de mémoire avec ce tableau écrit avant la première ligne de code : ça fait partie de l'infrastructure d'IA sur laquelle tournent les employés IA que nous mettons au travail, dans la logique générale de créer un agent IA qui tient en production. On ne vend pas de mémoire infinie. On facture le fait que ton agent retienne ce qu'il doit, pendant le temps qu'il doit, et que le jour où il faudra l'effacer, ça s'efface pour de bon.

Questions fréquentes

Le RAG, c'est que l'agent sache chercher dans ta documentation ; la mémoire, c'est que l'agent sache qui tu es la prochaine fois que tu lui parles. Le RAG travaille sur de la connaissance de l'organisation — manuels, politiques, procédures —, la même pour tout le monde, et son vrai problème n'est pas de se souvenir mais de trouver et d'être à jour. La mémoire à long terme stocke des faits précis sur une personne, un compte ou un dossier, appris pendant l'opération, et qui doivent survivre à la fin de la conversation. Tu peux avoir un RAG impeccable et un agent qui ne se souvient toujours pas que ce client s'est déjà plaint deux fois de la même commande : ce sont des problèmes différents avec des solutions différentes.

Trois couches, et elles se contractent, se paient et s'auditent séparément. (1) Le contexte de la conversation en cours : il vit dans la fenêtre de contexte du modèle, se vide à la fin du fil et se paie au token à chaque tour. (2) La connaissance consultable, qui est le RAG : elle vit dans un index sur tes documents et son coût dominant est l'entretien, pas le stockage. (3) La mémoire à long terme : elle vit dans un entrepôt dédié, hors du modèle, c'est l'agent qui l'écrit pendant l'opération, et son coût dominant est de gouvernance — qui relit ce qui est stocké et qui peut l'effacer. La règle pratique : commencer avec les deux premières, mesurer où ça casse vraiment et n'ajouter la troisième qu'avec les cas notés.

On peut, mais ce n'est presque jamais une seule opération, et c'est là qu'est le piège. Dès qu'un fait est copié à plus d'un endroit — l'entrepôt de mémoire, l'index, le journal de la conversation, le système de destination où l'agent a écrit — l'effacement cesse d'être un bouton et devient une procédure avec une liste d'endroits. La documentation de ChatGPT l'illustre bien : pour effacer complètement quelque chose que le système pourrait savoir de toi, il faut supprimer chaque source où cela apparaît — conversations passées, conversations archivées, fichiers, résumé de mémoire — et déconnecter les applications connectées susceptibles de le contenir ; en plus, supprimer une conversation n'efface pas les mémoires qui en sont sorties. Si personne n'a écrit cette liste d'endroits dans ton système, tu ne peux promettre d'effacer quoi que ce soit. Source : Memory FAQ, OpenAI Help Center, consulté le 10 septembre 2026.

Aucun texte ne parle de « mémoire des agents » sous ce nom, mais trois ancrages s'appliquent. Le droit à l'effacement du RGPD s'exerce sur les données personnelles que tu traites, et la mémoire d'un agent en contient par construction. Le Comité européen de la protection des données, dans son avis 28/2024 (17 décembre 2024), place la barre haut pour considérer comme anonyme un modèle entraîné sur des données personnelles et rappelle que, face à un traitement illicite, les autorités peuvent ordonner l'effacement du jeu de données ; cet avis discute du modèle, alors qu'un entrepôt de mémoire est un cas bien plus clairement identifiable. Et en France, la CNIL et le Conseil de l'IA et du Numérique ont publié en juillet 2026 une note exploratoire sur l'IA agentique qui met la mémoire persistante au centre du problème et recommande le cloisonnement de la mémoire des agents dès la conception. Aucun des trois ne te dit combien de temps ton agent doit retenir une préférence précise : ça, c'est ta politique, et sans l'écrire la politique par défaut est « pour toujours ». Source : IA agentique et données personnelles, CNIL et CIANum, 20 juillet 2026.

Trois questions sur le cas concret qui t'a fait penser à la mémoire. Un : la donnée qui te manque est-elle écrite dans un de tes documents ? Si oui, ce n'est pas de la mémoire, c'est de la récupération, et le problème est dans l'index ou dans le document. Deux : la donnée vaut-elle pour tous tes clients ou seulement pour celui-là ? Si elle vaut pour tous, c'est de la connaissance ; si elle est de celui-là et de personne d'autre, c'est de la mémoire à long terme. Trois : la donnée cesserait-elle d'être vraie d'ici un an ? Si oui, il te faut la couche d'oubli avant celle du souvenir. La plupart des « il nous faut de la mémoire » de la première réunion sont, vus de près, un index mal entretenu.

Plan d'Impact IA · gratuit

Le guide est générique. Ton plan, non.

Parle-nous de ton entreprise et on te renvoie un diagnostic avec priorités, chiffres et quoi implémenter en premier. Sans rendez-vous commercial, sans payer un euro.

La mémoire d'un agent IA : ce que c'est, pourquoi ce n'est pas du RAG et quand il faut le faire oublier · Implementa