Le RAG décrit comment une réponse est récupérée. L’ancrage est une règle sur ce que l’IA a le droit de dire. La génération augmentée par récupération cherche dans une source, met ce qu’elle trouve dans le prompt et génère une réponse. L’ancrage ajoute par-dessus trois contraintes : ne répondre qu’à partir de ce matériau, montrer d’où il vient, et refuser quand il ne couvre pas la question. Tout système ancré utilise la récupération. Tout système utilisant la récupération n’est pas ancré.
Cette distinction paraît théorique jusqu’au jour où l’on annonce à un client un mauvais délai de remboursement.
Ce que fait réellement le RAG
Sans récupération, un modèle de langue répond avec ce qu’il a absorbé pendant l’entraînement. Il n’a jamais vu votre politique de livraison, donc quand on l’interroge dessus, il produit quelque chose qui a la forme d’une politique de livraison. Fluide, assuré, inventé.
Le RAG règle le problème d’entrée. Votre contenu est découpé en passages puis indexé. Quand une question arrive, le système trouve les passages qui semblent les plus pertinents et les place dans le prompt à côté de la question. Le modèle a désormais votre vraie politique sous les yeux.
C’est une vraie amélioration et la plupart des outils de support par IA le font. C’est aussi là que la plupart s’arrêtent.
Pourquoi cela ne suffit pas
Rien dans le RAG n’oblige le modèle à rester dans le matériau qu’on lui a donné. Les passages récupérés sont un contexte, pas une clôture. Trois choses déraillent en pratique.
La récupération revient faible. Le client pose une question que votre site ne couvre pas, la recherche renvoie donc les passages les plus proches plutôt que les bons. Le modèle, à qui l’on tend un texte vaguement lié et une question, répond quand même. Il n’a aucun moyen de signaler que le matériau collait mal.
Le modèle comble les trous. Face à un passage couvrant quatre des cinq volets d’une question, un modèle complétera souvent le cinquième avec des connaissances générales, du même ton, sans couture visible. Impossible de voir où votre contenu s’est arrêté et où l’invention a commencé.
La question est mal comprise. C’est sur les relances que cela mord. « Il existe en bleu ? » est récupéré sur cette seule phrase, et le pronom n’a aucun référent : la recherche renvoie donc quelque chose de sans rapport, mais avec assurance. L’historique de conversation présent dans le prompt donne ensuite l’impression que l’assistant avait parfaitement compris.
Les trois choses qu’ajoute l’ancrage
L’ancrage n’est pas un meilleur moteur de récupération. C’est un ensemble de règles imposées autour du modèle.
Une source fermée. La réponse ne peut être construite qu’à partir du matériau récupéré. Ni l’internet ouvert, ni les données d’entraînement du modèle, ni un mélange des deux. Si ce n’est pas dans votre contenu, ce n’est pas disponible pour être dit.
Une réponse attribuable. Chaque réponse porte la page dont elle provient, affichée à la personne qui la lit. Cela fait plus que rassurer : cela rend le système auditable. Une mauvaise réponse cesse d’être un mystère sur le modèle et devient une page précise à corriger.
Une voie de refus. Quand la récupération ne trouve rien d’assez pertinent, le système ne répond pas. Il le dit et propose une personne. C’est la partie que les éditeurs escamotent, parce qu’un outil qui dit parfois « je ne sais pas » fait moins bonne impression en démonstration qu’un outil qui a toujours quelque chose à dire.
C’est cette troisième règle qui fait le vrai travail. L’ancrage se définit par ce qu’il refuse de faire.
Comment savoir lequel vous avez devant vous
Les pages des éditeurs emploient les deux mots indifféremment : testez plutôt que de lire.
- Posez une question que votre contenu ne couvre pas. Un système ancré le dit et propose un humain. Un système qui fait seulement du RAG répond quand même. Ce seul test les sépare.
- Vérifiez qu’une source figure sous chaque réponse, pas seulement sous certaines. Une citation occasionnelle signifie que la citation est décorative.
- Posez une relance contenant un pronom. « Il existe en bleu ? » après une question sur un produit. Si la réponse change de sujet, la récupération tourne sur la phrase brute, sans contexte.
- Demandez ce qu’il a lu. Si vous ne pouvez pas voir et corriger le contenu indexé, vous ne pouvez pas corriger une mauvaise réponse à sa cause.
- Demandez ce qui se passe quand la confiance est faible. S’il n’y a pas de réponse à cette question, il n’y a pas de plancher.
Le coût dont personne ne parle
Un système ancré répondra à moins de questions qu’un système non ancré. Ce n’est pas un défaut, c’est le compromis, et mieux vaut le regarder en face. Vous choisissez un plus petit nombre de réponses que vous pouvez assumer plutôt qu’un plus grand nombre que vous ne pouvez pas.
Pour une démonstration, le système non ancré l’emporte. Pour une entreprise où une mauvaise date de livraison est un remboursement et une mauvaise affirmation médicale bien pire, le compromis n’est même pas serré.
Et l’écart se referme de lui-même, parce que chaque refus est enregistré comme une question à laquelle votre contenu n’a pas répondu. Écrivez ces pages et la couverture augmente, sur une base qui reste vraie.
FAQ
Les réponses, avant même la question.
Quelle est la différence entre le RAG et l’ancrage ?
Le RAG est une technique : chercher dans une source, mettre ce qu’on trouve dans le prompt, générer une réponse. L’ancrage est une garantie de comportement : ne répondre qu’à partir de ce matériau, montrer d’où il vient, refuser quand il ne couvre pas la question. Le RAG, c’est la plomberie ; l’ancrage, c’est la règle.
Le RAG arrête-t-il les hallucinations ?
Il les réduit, il ne les arrête pas. Rien dans la récupération n’oblige le modèle à rester dans le matériau qu’on lui a donné : une récupération faible produit donc quand même une réponse fluide tirée de connaissances générales.
Comment tester si un outil est ancré ?
Posez-lui une question que votre contenu ne couvre pas. Un système ancré dit qu’il ne sait pas et propose une personne. Un système qui fait seulement du RAG répond quand même.
Un assistant ancré est-il moins utile ?
Il répond à moins de questions, et chaque réponse est une réponse que vous pouvez assumer. Les refus deviennent aussi une liste classée de pages à écrire, si bien que la couverture augmente avec le temps.
Faites le test sur votre propre site.
Ajoutez votre site, posez-lui une question que vos pages ne couvrent pas, et regardez ce qu’il fait ensuite. Gratuit pour commencer.
Sans carte bancaire pour commencer.