Causerie

🧠 RAG & documentation · 8 min de lecture

RAG : pourquoi les chatbots saturent sur 500 PDF

Fenêtre de contexte, saturation, « lost in the middle » : pourquoi les chatbots IA s'effondrent sur une grosse doc, et comment le RAG règle ça.

Par Mathias Igonenc, cofondateur de Causerie · mis à jour le 5 août 2026

Illustration 3D du RAG : des piles de documents et de classeurs empilés, une loupe éclaire une seule page au milieu
Le RAG retrouve la bonne page dans des centaines de documents avant de répondre.
Sommaire · 6 sections

Un chatbot IA nourri de 10 pages répond bien. Le même bot nourri de 500 PDF se met à mélanger les produits, oublier les consignes et inventer des réponses. Ce n'est pas un bug : c'est une limite architecturale, et elle a une solution qui s'appelle le RAG.

La fenêtre de contexte : la mémoire de travail de l'IA

Un modèle de langage ne « connaît » pas votre entreprise : à chaque message, on lui transmet un texte (le prompt) qui contient vos instructions, votre documentation et la question du visiteur. Ce texte doit tenir dans sa fenêtre de contexte : sa mémoire de travail. Elle se mesure en tokens (grossièrement, un token vaut trois quarts d'un mot en français).

Les fenêtres modernes sont grandes sur le papier (des centaines de milliers de tokens). Le réflexe naïf est donc : « collons toute la doc dedans ». C'est exactement ce que font la plupart des chatbots d'entrée de gamme, et c'est là que les ennuis commencent.

Ce qui se passe vraiment quand le prompt sature

Bien avant d'atteindre la limite théorique, la qualité se dégrade. Les praticiens le constatent systématiquement : au-delà d'environ 60 à 70 % de remplissage de la fenêtre, un modèle « perd le milieu » : il retrouve bien les informations du début et de la fin du prompt, mais rate celles noyées au centre. Les chercheurs appellent ça le problème du lost in the middle.

  • Le bot mélange : deux produits aux noms proches fusionnent en une réponse hybride fausse.
  • Le bot oublie ses consignes : le ton et les interdits définis en tête de prompt se diluent dans la masse.
  • Le bot invente : ne retrouvant pas l'information, il comble le vide avec du plausible : c'est l'hallucination classique.
  • La facture explose : chaque message envoie toute la documentation au modèle, et chaque token se paie.

Le paradoxe du PDF de plus

Sur une architecture à prompt farci, enrichir la documentation DÉGRADE le bot : chaque ajout dilue davantage l'information utile. Vous travaillez contre vous-même.

Le RAG : ne transmettre que ce qui sert

Le RAG (Retrieval-Augmented Generation, génération augmentée par récupération) prend le problème à l'envers. Au lieu d'envoyer toute la documentation à chaque message :

  • 1. Découpage : vos documents sont segmentés en fragments cohérents (des « chunks »).
  • 2. Vectorisation : chaque fragment est converti en représentation mathématique de son sens (embedding), stockée dans un index.
  • 3. Récupération : à chaque question, une recherche sémantique identifie les 3 à 10 fragments les plus pertinents : eux seuls partent au modèle.
  • 4. Génération : le modèle répond à partir d'un contexte court, dense et pertinent : précis, rapide, économique.

Conséquence directe : la taille totale de votre documentation devient indifférente. 50 pages ou 5 000, le modèle reçoit toujours un contexte de la même taille : les meilleurs extraits. C'est l'architecture de la base de connaissances Causerie, et la raison pour laquelle le plan Business affiche « PDF et URLs illimités » sans astérisque.

Prompt farci vs RAG : le tableau

CritèrePrompt farciRAG
Volume documentaire maxQuelques dizaines de pages utilesIllimité
Précision sur gros volumeS'effondre (lost in the middle)Stable
Coût par messageProportionnel à TOUTE la docProportionnel aux extraits utiles
Mise à jourRe-coller toute la docResynchroniser la source
Risque d'hallucinationCroît avec le volumeRéduit (contexte ciblé)

Comment vérifier avant d'acheter

Trois questions à poser à tout éditeur de chatbot, et les réponses qui doivent vous alerter :

  • « Comment gérez-vous 500 PDF ? » : si la réponse est « la fenêtre de contexte est très grande », fuyez : c'est du prompt farci.
  • « Que reçoit exactement le modèle à chaque question ? » : la bonne réponse mentionne une recherche (sémantique, vectorielle) et un nombre limité d'extraits.
  • « Que se passe-t-il quand j'ajoute un document ? » : la bonne réponse : il est découpé et indexé, sans impact sur le reste.

Et le test le plus simple reste empirique : chargez votre vraie documentation dans un compte d'essai, posez vingt questions précises dont vous connaissez les réponses, comptez les erreurs. La démo Causerie se prête à l'exercice sans carte bancaire.

En bref

  • Pourquoi mon chatbot devient mauvais quand j'ajoute des documents ? Parce qu'il colle tout dans le prompt : au-delà de ~60-70 % de remplissage, le modèle perd le milieu du contexte. La solution est architecturale : le RAG.
  • Le RAG élimine-t-il les hallucinations ? Il les réduit fortement (contexte court et pertinent) sans les éliminer : les garde-fous restent nécessaires : voir notre guide anti-hallucinations.
  • « Fenêtre de contexte géante » = problème réglé ? Non : le coût par message et le lost in the middle demeurent. Une grande fenêtre aide, elle ne remplace pas la récupération ciblée.

Lancez votre bot. Avant la fin de votre café.

5 minutes pour installer. Gratuit pour toujours sur la formule de base. Sans carte bancaire, sans code, sans excuse.

Pas encore de site ? Ouvrir le configurateur →

Sans compte pour essayer · Gratuit pour toujours · Sans carte bancaire