Un chatbot IA nourri de 10 pages répond bien. Le même bot nourri de 500 PDF se met à mélanger les produits, oublier les consignes et inventer des réponses. Ce n'est pas un bug : c'est une limite architecturale, et elle a une solution qui s'appelle le RAG.
La fenêtre de contexte : la mémoire de travail de l'IA
Un modèle de langage ne « connaît » pas votre entreprise : à chaque message, on lui transmet un texte (le prompt) qui contient vos instructions, votre documentation et la question du visiteur. Ce texte doit tenir dans sa fenêtre de contexte : sa mémoire de travail. Elle se mesure en tokens (grossièrement, un token vaut trois quarts d'un mot en français).
Les fenêtres modernes sont grandes sur le papier (des centaines de milliers de tokens). Le réflexe naïf est donc : « collons toute la doc dedans ». C'est exactement ce que font la plupart des chatbots d'entrée de gamme, et c'est là que les ennuis commencent.
Ce qui se passe vraiment quand le prompt sature
Bien avant d'atteindre la limite théorique, la qualité se dégrade. Les praticiens le constatent systématiquement : au-delà d'environ 60 à 70 % de remplissage de la fenêtre, un modèle « perd le milieu » : il retrouve bien les informations du début et de la fin du prompt, mais rate celles noyées au centre. Les chercheurs appellent ça le problème du lost in the middle.
- ✓Le bot mélange : deux produits aux noms proches fusionnent en une réponse hybride fausse.
- ✓Le bot oublie ses consignes : le ton et les interdits définis en tête de prompt se diluent dans la masse.
- ✓Le bot invente : ne retrouvant pas l'information, il comble le vide avec du plausible : c'est l'hallucination classique.
- ✓La facture explose : chaque message envoie toute la documentation au modèle, et chaque token se paie.
Le paradoxe du PDF de plus
Sur une architecture à prompt farci, enrichir la documentation DÉGRADE le bot : chaque ajout dilue davantage l'information utile. Vous travaillez contre vous-même.
Le RAG : ne transmettre que ce qui sert
Le RAG (Retrieval-Augmented Generation, génération augmentée par récupération) prend le problème à l'envers. Au lieu d'envoyer toute la documentation à chaque message :
- ✓1. Découpage : vos documents sont segmentés en fragments cohérents (des « chunks »).
- ✓2. Vectorisation : chaque fragment est converti en représentation mathématique de son sens (embedding), stockée dans un index.
- ✓3. Récupération : à chaque question, une recherche sémantique identifie les 3 à 10 fragments les plus pertinents : eux seuls partent au modèle.
- ✓4. Génération : le modèle répond à partir d'un contexte court, dense et pertinent : précis, rapide, économique.
Conséquence directe : la taille totale de votre documentation devient indifférente. 50 pages ou 5 000, le modèle reçoit toujours un contexte de la même taille : les meilleurs extraits. C'est l'architecture de la base de connaissances Causerie, et la raison pour laquelle le plan Business affiche « PDF et URLs illimités » sans astérisque.
Prompt farci vs RAG : le tableau
| Critère | Prompt farci | RAG |
|---|---|---|
| Volume documentaire max | Quelques dizaines de pages utiles | Illimité |
| Précision sur gros volume | S'effondre (lost in the middle) | Stable |
| Coût par message | Proportionnel à TOUTE la doc | Proportionnel aux extraits utiles |
| Mise à jour | Re-coller toute la doc | Resynchroniser la source |
| Risque d'hallucination | Croît avec le volume | Réduit (contexte ciblé) |
Comment vérifier avant d'acheter
Trois questions à poser à tout éditeur de chatbot, et les réponses qui doivent vous alerter :
- ✓« Comment gérez-vous 500 PDF ? » : si la réponse est « la fenêtre de contexte est très grande », fuyez : c'est du prompt farci.
- ✓« Que reçoit exactement le modèle à chaque question ? » : la bonne réponse mentionne une recherche (sémantique, vectorielle) et un nombre limité d'extraits.
- ✓« Que se passe-t-il quand j'ajoute un document ? » : la bonne réponse : il est découpé et indexé, sans impact sur le reste.
Et le test le plus simple reste empirique : chargez votre vraie documentation dans un compte d'essai, posez vingt questions précises dont vous connaissez les réponses, comptez les erreurs. La démo Causerie se prête à l'exercice sans carte bancaire.
En bref
- ✓Pourquoi mon chatbot devient mauvais quand j'ajoute des documents ? Parce qu'il colle tout dans le prompt : au-delà de ~60-70 % de remplissage, le modèle perd le milieu du contexte. La solution est architecturale : le RAG.
- ✓Le RAG élimine-t-il les hallucinations ? Il les réduit fortement (contexte court et pertinent) sans les éliminer : les garde-fous restent nécessaires : voir notre guide anti-hallucinations.
- ✓« Fenêtre de contexte géante » = problème réglé ? Non : le coût par message et le lost in the middle demeurent. Une grande fenêtre aide, elle ne remplace pas la récupération ciblée.