Causerie

🧠 RAG & documentation · 8 min de lecture

RAG : pourquoi les chatbots saturent sur 500 PDF

Fenêtre de contexte, saturation, « lost in the middle » : pourquoi les chatbots IA s'effondrent sur une grosse doc, et comment le RAG règle ça.

Par l'équipe Causerie · mis à jour le 5 août 2026

Un chatbot IA nourri de 10 pages répond bien. Le même bot nourri de 500 PDF se met à mélanger les produits, oublier les consignes et inventer des réponses. Ce n'est pas un bug : c'est une limite architecturale, et elle a une solution qui s'appelle le RAG.

La fenêtre de contexte : la mémoire de travail de l'IA

Un modèle de langage ne « connaît » pas votre entreprise : à chaque message, on lui transmet un texte (le prompt) qui contient vos instructions, votre documentation et la question du visiteur. Ce texte doit tenir dans sa fenêtre de contexte : sa mémoire de travail. Elle se mesure en tokens (grossièrement, un token vaut trois quarts d'un mot en français).

Les fenêtres modernes sont grandes sur le papier (des centaines de milliers de tokens). Le réflexe naïf est donc : « collons toute la doc dedans ». C'est exactement ce que font la plupart des chatbots d'entrée de gamme, et c'est là que les ennuis commencent.

Ce qui se passe vraiment quand le prompt sature

Bien avant d'atteindre la limite théorique, la qualité se dégrade. Les praticiens le constatent systématiquement : au-delà d'environ 60 à 70 % de remplissage de la fenêtre, un modèle « perd le milieu » : il retrouve bien les informations du début et de la fin du prompt, mais rate celles noyées au centre. Les chercheurs appellent ça le problème du lost in the middle.

Le paradoxe du PDF de plus

Sur une architecture à prompt farci, enrichir la documentation DÉGRADE le bot : chaque ajout dilue davantage l'information utile. Vous travaillez contre vous-même.

Le RAG : ne transmettre que ce qui sert

Le RAG (Retrieval-Augmented Generation, génération augmentée par récupération) prend le problème à l'envers. Au lieu d'envoyer toute la documentation à chaque message :

Conséquence directe : la taille totale de votre documentation devient indifférente. 50 pages ou 5 000, le modèle reçoit toujours un contexte de la même taille : les meilleurs extraits. C'est l'architecture de la base de connaissances Causerie, et la raison pour laquelle le plan Business affiche « PDF et URLs illimités » sans astérisque.

Prompt farci vs RAG : le tableau

CritèrePrompt farciRAG
Volume documentaire maxQuelques dizaines de pages utilesIllimité
Précision sur gros volumeS'effondre (lost in the middle)Stable
Coût par messageProportionnel à TOUTE la docProportionnel aux extraits utiles
Mise à jourRe-coller toute la docResynchroniser la source
Risque d'hallucinationCroît avec le volumeRéduit (contexte ciblé)

Comment vérifier avant d'acheter

Trois questions à poser à tout éditeur de chatbot, et les réponses qui doivent vous alerter :

Et le test le plus simple reste empirique : chargez votre vraie documentation dans un compte d'essai, posez vingt questions précises dont vous connaissez les réponses, comptez les erreurs. La démo Causerie se prête à l'exercice sans carte bancaire.

En bref

Lancez votre bot. Avant la fin de votre café.

5 minutes pour installer. Gratuit pour toujours sur la formule de base. Sans carte bancaire, sans code, sans excuse.

Créer mon chatbot, c'est gratuit →

Gratuit pour toujours · Sans carte bancaire · 1 ligne de code