En bref — Tokens, fenêtre de contexte, limite LLM : comprends enfin pourquoi ton IA oublie ou se plante, sans maths ni jargon.
Image : Alan Cleaver — Openverse (by)
En bref — Un token est un fragment de texte que l'IA lit et traite ; la fenêtre de contexte est la quantité maximale de tokens qu'elle peut garder en mémoire à la fois. Quand tu dépasses cette limite, le modèle "oublie" le début de ta conversation — et ses réponses se dégradent.
Tu poses une question à ChatGPT en milieu de longue conversation, et la réponse part dans tous les sens. Ou tu colles un document de dix pages et le modèle rate des informations pourtant présentes dans le texte. Ce n'est pas un bug aléatoire. C'est une limite physique du modèle, liée aux tokens et à la fenêtre de contexte. Voici ce que ça veut dire, sans formule mathématique.
C'est quoi un token ? L'analogie concrète
Un token, c'est un morceau de texte. Pas forcément un mot entier — plutôt une syllabe, un mot court, ou la racine d'un mot long.
Imagine que tu découpes une phrase avec des ciseaux, en morceaux de taille variable. Certains morceaux sont des mots complets ("chat", "table", "IA"), d'autres sont des fragments ("trans", "forma", "tion"). Le modèle lit ces morceaux un par un, dans l'ordre. C'est ça, un token.
En pratique pour le français :
- Un mot courant = environ 1 à 2 tokens
- Un mot technique ou composé = souvent 2 à 4 tokens
- 1 000 tokens ≈ 700 à 750 mots
Pourquoi c'est important ? Parce que tout ce que tu envoies au modèle — ton prompt, les pièces jointes, l'historique de conversation, les instructions système — consomme des tokens. Et le modèle a un quota.
Consulte l'annuaire d'outils IA pour voir quels modèles sont disponibles et leurs caractéristiques principales.
Pourquoi la fenêtre de contexte change tout à tes résultats
La fenêtre de contexte, c'est la quantité totale de tokens que le modèle peut "voir" en même temps. Pense à une table de travail : plus elle est grande, plus tu peux étaler de documents dessus. Si la table est petite, tu dois ranger certains papiers pour en sortir d'autres.
Le modèle ne lit pas ta conversation dans un fichier quelque part. Il traite tout ce qui tient dans cette fenêtre, ici et maintenant. Ce qui dépasse la limite n'existe plus pour lui.
Conséquences directes sur tes résultats :
- Cohérence sur la durée — Dans une longue conversation, si le contexte déborde, le modèle perd le fil de tes instructions initiales. Il peut contredire ce qu'il a dit 20 messages plus tôt.
- Analyse de documents — Si tu colles un texte trop long, le modèle peut rater des passages entiers, surtout ceux au milieu du document (c'est un phénomène connu, parfois appelé "lost in the middle").
- Qualité des prompts système — Tes instructions de cadrage consomment aussi des tokens. Un prompt système verbeux laisse moins de place pour le contenu réel.
La fenêtre de contexte n'est pas qu'un plafond technique. C'est un paramètre de qualité qui conditionne directement la pertinence des réponses.
Ce qui se passe quand tu dépasses la limite — et comment l'éviter
Quand la fenêtre est pleine, le modèle ne plante pas avec un message d'erreur. Il continue, mais en silence, il "oublie" les échanges les plus anciens. C'est là que les réponses deviennent incohérentes ou hors sujet sans raison apparente.
Signes que tu approches ou dépasses la limite :
- Le modèle ignore des instructions données en début de conversation
- Il répète des informations qu'il vient de produire
- Il perd le ton ou le format que tu lui avais demandé
- Ses réponses deviennent génériques, comme s'il repartait de zéro
Ce que tu peux faire concrètement :
- Résume régulièrement — En milieu de longue conversation, demande au modèle de produire un résumé des points clés, puis commence une nouvelle session en collant ce résumé comme contexte de départ.
- Segmente tes documents — Plutôt que de coller 15 pages d'un coup, découpe en sections et traite-les une par une.
- Allège ton prompt système — Garde les instructions essentielles, supprime le superflu. Chaque token d'instruction, c'est un token en moins pour le contenu.
- Choisis le bon modèle — Si tu travailles régulièrement sur de longs documents, oriente-toi vers un modèle avec une grande fenêtre de contexte (voir tableau ci-dessous).
- Utilise des outils RAG — Pour les bases de connaissance volumineuses, des systèmes de type RAG (Retrieval-Augmented Generation) injectent uniquement les passages pertinents dans le contexte, plutôt que tout le document.
Pour aller plus loin sur l'automatisation de ces workflows, consulte les cas d'usage ou explore la bibliothèque de prompts pour des exemples de prompts de résumé et de segmentation.
Comparatif : les fenêtres de contexte des principaux modèles
Les chiffres ci-dessous sont indicatifs — les éditeurs font évoluer leurs modèles régulièrement. Vérifie toujours la documentation officielle avant de choisir.
| Modèle | Fenêtre de contexte (approx.) | Usage typique |
|---|---|---|
| GPT-4o (OpenAI) | 128 000 tokens | Usage général, conversations longues |
| GPT-4o mini (OpenAI) | 128 000 tokens | Usage général, coût réduit |
| Claude 3.5 Sonnet (Anthropic) | 200 000 tokens | Analyse de longs documents, contrats |
| Claude 3 Opus (Anthropic) | 200 000 tokens | Tâches complexes sur textes longs |
| Gemini 1.5 Pro (Google) | 1 000 000 tokens | Documents très volumineux, vidéos |
| Gemini 1.5 Flash (Google) | 1 000 000 tokens | Rapidité + volume, coût maîtrisé |
| Llama 3.1 (Meta, open source) | 128 000 tokens | Déploiement local ou cloud privé |
| Mistral Large (Mistral AI) | 128 000 tokens | Option souveraine européenne |
Ce que ce tableau ne dit pas : une grande fenêtre de contexte ne garantit pas une bonne qualité de traitement sur tout le texte. Les modèles ont tendance à mieux traiter le début et la fin de la fenêtre que le milieu. Pour un document critique, teste toujours le résultat.
Pour les PME qui traitent des données sensibles, la question de la souveraineté compte autant que la taille de la fenêtre. Consulte les statistiques IA & PME pour des données sur l'adoption et les enjeux de conformité.
Comprendre les tokens et la fenêtre de contexte, c'est comprendre pourquoi ton IA se comporte comme elle le fait — et comment en tirer des résultats plus fiables. Ce n'est pas de la théorie : ça change directement la façon dont tu structures tes prompts et choisis tes outils.
Si tu veux savoir quels modèles et quels workflows sont adaptés à ton cas précis, le diagnostic IA gratuit te donne une réponse concrète en moins d'une heure.