RAG (génération augmentée par récupération)
Le RAG (Retrieval-Augmented Generation) est une architecture où l'IA va d'abord chercher les extraits pertinents dans une base documentaire, puis génère sa réponse à partir de ces seuls extraits.
Concrètement : vos documents sont découpés en fragments, convertis en vecteurs et indexés. À chaque question, une recherche sémantique remonte les 3 à 10 fragments les plus proches du sens de la question, et eux seuls sont transmis au modèle. Résultat : une documentation illimitée devient exploitable, sans saturer la fenêtre de contexte ni exploser le coût par message.
Voir aussi : Fenêtre de contexte · Embedding · Hallucination
Fenêtre de contexte
La fenêtre de contexte est la quantité maximale de texte qu'un modèle d'IA peut traiter en une seule fois : ses instructions, les documents fournis et la question de l'utilisateur.
Elle se mesure en tokens. Attention au piège : bien avant d'atteindre la limite théorique, la qualité se dégrade. Au-delà d'environ 60 à 70 % de remplissage, les modèles « perdent le milieu » du contexte (phénomène du lost in the middle) : ils retiennent le début et la fin, et ratent ce qui est au centre.
Voir aussi : Token · RAG
Token
Un token est l'unité de découpage du texte par un modèle d'IA : environ trois quarts d'un mot en français.
Les modèles facturent et raisonnent en tokens, pas en mots. Un document de 1 000 mots pèse environ 1 300 tokens. C'est l'unité qui détermine à la fois le coût d'un message et la place occupée dans la fenêtre de contexte.
Voir aussi : Fenêtre de contexte
Hallucination
Une hallucination est une réponse inventée par une IA, formulée avec assurance mais fausse : un prix, une garantie ou une procédure qui n'existent pas.
Les causes principales : un contexte pauvre (le modèle comble le vide), un prompt saturé (l'information existe mais se perd dans la masse), ou une question hors du périmètre couvert. On les réduit fortement avec un RAG bien réglé, des instructions qui autorisent explicitement le « je ne sais pas », et un hand-off vers l'humain.
Voir aussi : RAG · Hand-off · Prompt système
Embedding (vectorisation)
Un embedding est la représentation mathématique du sens d'un texte : une liste de nombres qui permet de comparer des contenus par leur signification plutôt que par leurs mots exacts.
C'est ce qui permet à une recherche sémantique de comprendre que « frais de port » et « coût de livraison » parlent de la même chose. Dans un chatbot RAG, chaque fragment de votre documentation possède son embedding, et la question du visiteur est comparée à eux.
Voir aussi : RAG · Recherche sémantique
Recherche sémantique
La recherche sémantique retrouve des contenus par leur sens plutôt que par la correspondance exacte des mots-clés.
Une recherche classique sur « remboursement » ne trouve pas un document qui parle de « retour et avoir ». La recherche sémantique, elle, les rapproche. C'est le mécanisme qui sélectionne les bons extraits dans un chatbot RAG.
Voir aussi : Embedding · RAG
NLP (traitement du langage naturel)
Le NLP (Natural Language Processing) désigne l'ensemble des techniques qui permettent à une machine de comprendre et produire du langage humain.
Historiquement, les chatbots NLP reconnaissaient des « intentions » prédéfinies à partir de phrases d'exemple. Les modèles de langage actuels ont largement dépassé cette approche : ils comprennent des formulations jamais vues, sans entraînement spécifique par intention.
Voir aussi : Chatbot à scénarios · Modèle de langage
Modèle de langage (LLM)
Un modèle de langage est un système d'IA entraîné à produire du texte cohérent : GPT-4o, Claude, Gemini et Mistral en sont des exemples.
Un chatbot d'entreprise n'est pas un modèle : c'est une couche qui apporte VOS contenus et VOS règles à un modèle. C'est pourquoi il est utile de pouvoir en changer sans reconfigurer son bot, selon l'arbitrage puissance, vitesse et souveraineté.
Voir aussi : Token · Hallucination