📖 LLM · Page 2/5

Comment un LLM « sait »

L'entraînement, le fine-tuning et le RLHF — comment naît l'intelligence d'un modèle

La métaphore
Un LLM apprend comme un enfant qui lit l'intégralité de la bibliothèque publique. D'abord, il absorbe tout (pré-entraînement). Ensuite, un tuteur lui montre comment bien répondre aux questions (fine-tuning). Enfin, des milliers de lecteurs lui donnent des notes sur ses réponses, et il s'améliore selon ces retours (RLHF). Mais contrairement à l'enfant, il ne « comprend » pas vraiment — il calcule des probabilités.

Phase 1 — Le pré-entraînement

Le pré-entraînement est la phase fondatrice. Le modèle ingère d'énormes quantités de texte : pages web, livres, articles scientifiques, code source, forums, Wikipedia…

La tâche est simple : prédire le mot suivant, encore et encore, des milliards de fois. En se trompant et en se corrigeant sur des milliards d'exemples, le réseau de neurones développe des représentations de plus en plus précises du langage et des concepts.

Ordre de grandeur du pré-entraînement
📄
Des trillions de tokens de texte
GPT-3 : ~300 milliards de tokens. Les modèles modernes : plusieurs trillions.
Des milliers de GPU pendant des semaines
Le coût d'entraînement d'un grand modèle se chiffre en dizaines à centaines de millions de dollars.
🧠
Des milliards de paramètres ajustés
GPT-4, Claude, Gemini : non divulgués. Llama 4 Maverick (Meta) : ~400 milliards déclarés. C'est le "poids" du modèle.
ℹ️ La date de coupure
Le pré-entraînement s'arrête à une date précise — la date de coupure. Tout ce qui s'est passé après reste inconnu du modèle. Claude Sonnet 4.6 a une coupure en août 2025.

Phase 2 — Le fine-tuning supervisé

Après le pré-entraînement, le modèle sait "parler" mais pas nécessairement "bien répondre". Il peut générer du texte fluide mais aussi des choses inappropriées, hors-sujet, ou inutiles.

Le fine-tuning supervisé corrige ça. Des humains créent des milliers d'exemples de bons dialogues (question → réponse idéale), et le modèle est réentraîné sur ces exemples pour apprendre à être un bon assistant.

Phase 3 — Le RLHF

RLHF (Reinforcement Learning from Human Feedback) est la dernière étape qui transforme un bon modèle en excellent assistant.

Le principe : le modèle génère plusieurs réponses à une même question. Des annotateurs humains les classent de la meilleure à la moins bonne. Un modèle de récompense apprend ces préférences, puis guide le LLM vers les réponses que les humains préfèrent.

Boucle RLHF simplifiée
1
Le LLM génère plusieurs réponses
Pour la même question, 4 ou 5 réponses différentes sont produites.
2
Des humains les classent
« La réponse A est meilleure que B, B meilleure que C… »
3
Un modèle de récompense apprend
Il prédit ce que les humains préfèrent.
4
Le LLM s'ajuste
Il génère des réponses mieux notées par le modèle de récompense. Itéré des milliers de fois.

Sur quoi peut-on vraiment lui faire confiance ?

Pas toutes les réponses d'un LLM se valent. La fiabilité dépend du type de sujet :

Fiabilité relative par domaine
Faits historiques bien documentés
Élevée
Langues, grammaire, traduction
Élevée
Code (langages populaires)
Bonne
Raisonnement logique / maths simples
Moyenne
Actualité récente (après coupure)
Faible
Citations, URLs, références précises
Faible
✅ Règle pratique
Plus un sujet est précis, daté, et peu documenté — moins le LLM est fiable. Les grands classiques bien documentés → fiable. Les chiffres précis, les citations exactes, les événements récents → vérifier.