Le pipeline d’entraînement d’un LLM
1
Collecte et préparation des données
Les développeurs agrègent d’immenses corpus de textes issus d’Internet, de livres numérisés, d’articles scientifiques, de bases de code et d’autres sources. Ce corpus peut représenter des billions de tokens. Les données sont ensuite filtrées (suppression de contenus dupliqués, toxiques ou de mauvaise qualité) et tokenisées.
2
Pré-entraînement (*pre-training*)
Le modèle apprend une seule tâche : prédire le token suivant dans un texte. Répétée des milliards de fois sur l’ensemble du corpus, cette tâche apparemment simple force le modèle à développer une représentation interne du langage, des faits du monde et des relations logiques. Cette phase est la plus coûteuse : elle peut mobiliser des milliers de GPU pendant des semaines ou des mois.
3
Ajustement supervisé (*Supervised Fine-Tuning, SFT*)
Le modèle de base est ensuite affiné sur un dataset de conversations de haute qualité, rédigées ou validées par des humains. Des paires (instruction → réponse idéale) lui apprennent à suivre des directives et à adopter un format conversationnel utile.
4
RLHF : Apprentissage par renforcement avec retour humain
Des annotateurs humains comparent plusieurs réponses générées par le modèle et les classent de la meilleure à la moins bonne. Ces préférences servent à entraîner un modèle de récompense, qui évalue automatiquement la qualité d’une réponse. Le LLM est ensuite optimisé pour maximiser ce score de récompense via un algorithme d’apprentissage par renforcement (généralement PPO). C’est cette étape qui rend le modèle utile, inoffensif et honnête.
5
Évaluation, sécurité et déploiement
Le modèle est soumis à des benchmarks standardisés, à des tests de sécurité (red teaming) et à des évaluations humaines avant d’être mis à disposition via une API ou une interface utilisateur.
Le RLHF expliqué simplement
Le Reinforcement Learning from Human Feedback (RLHF) est l’innovation clé qui a transformé les LLM en assistants réellement utiles. L’idée centrale : au lieu de définir mathématiquement ce qu’est une “bonne réponse” (tâche extrêmement difficile), on demande à des humains de comparer des réponses et d’exprimer leurs préférences. Imaginez que le modèle génère deux réponses à la question “Comment apprendre la guitare ?”. Des annotateurs humains indiquent laquelle est plus utile, plus précise, plus adaptée. Ces signaux humains créent un modèle de récompense qui apprend à prédire les préférences humaines, et le LLM apprend ensuite à maximiser cette récompense.Fine-tuning vs in-context learning
Lorsque vous souhaitez adapter un LLM à une tâche spécifique (répondre uniquement dans un certain style, maîtriser le jargon de votre secteur, suivre un format de sortie précis), deux grandes approches s’offrent à vous.- Fine-tuning
- In-context learning
Le fine-tuning consiste à reprendre les poids d’un modèle pré-entraîné et à continuer son entraînement sur votre propre dataset, spécifique à votre tâche.Avantages :
- Performances optimales sur la tâche ciblée
- Pas besoin de répéter les instructions dans chaque prompt
- Réduction des coûts à long terme (prompts plus courts)
- Possibilité d’apprendre des connaissances propriétaires
- Nécessite un dataset de qualité (souvent plusieurs centaines à milliers d’exemples)
- Coût d’entraînement et de maintenance
- Risque de surapprentissage (overfitting) si les données sont insuffisantes
- Moins flexible : le modèle peut perdre des capacités générales
Ce que vous pouvez (et ne pouvez pas) contrôler
En tant qu’utilisateur ou développeur s’appuyant sur un LLM via une API, voici ce que vous pouvez influencer : Vous pouvez contrôler :- Le prompt système (system prompt) : les instructions de base qui définissent le comportement du modèle
- La température : un paramètre qui règle la créativité vs la précision des réponses (0 = déterministe, 1+ = créatif)
- Le nombre maximum de tokens générés en sortie
- Les exemples fournis en contexte (few-shot learning)
- Le fine-tuning si vous avez accès à l’API d’entraînement
- Les poids du modèle de base (sauf si vous entraînez votre propre modèle)
- Les données d’entraînement utilisées par le fournisseur
- Les garde-fous de sécurité intégrés par le fournisseur
- La date de coupure des connaissances (knowledge cutoff)
