Dans cette leçon
Du continuateur brut à l’assistant
Dans le modèle
Du texte au token suivant
Un modèle de base ne sait que continuer du texte. Faites passer la même tour par son école de finition - dialogues exemplaires, puis préférences humaines - et apprenez ce que ce pilotage garantit, et ne garantit pas.
À la fin, vous saurez
- Expliquer ce que l’affinage supervisé et l’ajustement par préférences changent chacun à un modèle de base.
- Énoncer ce que le pilotage d’alignement ne garantit pas, et pourquoi les outils et la récupération existent.
Avant de commencer : L’entraînement, la machine qui corrige ses nombres
Demandez à un modèle fraîchement entraîné pourquoi le ciel est bleu, et il peut vous répondre par d’autres questions sur la mer et sur l’herbe. Il n’est pas cassé. Il fait, à la perfection, la seule chose que les chapitres 1 à 7 ont jamais construite : continuer un texte comme ses données le continuent. Sur le web, une question est le plus souvent suivie d’une autre question, d’une liste, d’une publicité. La distance entre ce perroquet magnifique et l’assistant qui vous répond poliment chaque jour est courte, mécanique, et mérite d’être vue exactement - car c’est aussi là que vivent les dernières illusions sur ces systèmes.
Observez une tour, trois écoles
Le laboratoire ci-dessous montre la même architecture à trois étapes : le modèle de base, le modèle après affinage supervisé (SFT), et le modèle après ajustement par préférences. Même tour, même attention, même softmax - seuls les nombres changent. Chaque sortie affichée est une illustration écrite à la main de comportements documentés par la recherche ; aucun vrai modèle n’a été interrogé.
Prédisez la réaction du modèle de base
Donnez à l’étape de base une consigne simple : Traduis « chat » en anglais.
Votre pari
Que fait le modèle de base d’une consigne claire et polie ?
Personne ne corrige. Engagez-vous, l’instrument tranchera.
Une seule architecture, trois jeux de nombres. Ces sorties sont des illustrations écrites à la main de comportements documentés, pas des mesures d’un vrai modèle.
Ce que le modèle écrit
Traduis « chat » en anglais.
Traduis « chien » en anglais. Traduis « maison » en anglais. Exercice 3 : conjuguez les verbes suivants.
Premiers candidats au token suivant
| Token | Part |
|---|---|
| Traduis | 38 % |
| Exercice | 21 % |
| cat | 9 % |
| …autres tokens | 32 % |
Inspecter le masque SFT
Pendant le SFT, la même entropie croisée du chapitre 7 tourne - mais seuls les tokens de la réponse comptent dans la perte. Le modèle apprend à répondre, pas à répéter la question.
Pourquoilecielest-ilbleu?Parcequel’airdiffuselalumièrebleue.
requête · ignoré par la perteréponse · compté dans la perte
Manipulez les trois étapes
Le modèle de base a répondu à votre consigne par… d’autres devoirs. Rien, dans l’entraînement au token suivant, ne récompense l’obéissance ; la suite la plus probable d’un exercice, sur le web, c’est l’exercice suivant. Cliquez maintenant d’étape en étape et regardez le token de tête basculer. Avec le SFT, « cat » bondit au sommet : des milliers de dialogues exemplaires ont appris à la tour qu’après une consigne vient son exécution. Essayez ensuite la requête d’insulte aux trois étapes. Le modèle de base continue un fil de forum. Le modèle SFT obéit avec zèle - on l’a entraîné à répondre, il répond. Seul le modèle ajusté par préférences décline et propose autre chose.
Défi Deux missions. Un : ouvrez l’inspecteur du masque SFT et expliquez pourquoi les tokens de la requête sont exclus de la perte - qu’apprendrait un modèle entraîné sur des dialogues sans masque ? Deux : sur les trois étapes de la requête d’insulte, suivez la probabilité du token qui ouvre le refus. Dites en une phrase quel type de données l’a fait monter.
Expliquez l’école de finition
Les deux étapes de l’école de finition recyclent une machinerie que vous possédez déjà :
- L’affinage supervisé est l’entropie croisée du chapitre 7 sur un régime choisi : des dialogues écrits pour être exemplaires, avec la perte masquée pour ne compter que les tokens de la réponse. Le modèle apprend la forme de la réponse - il n’apprend aucun fait nouveau sur le ciel.
- L’ajustement par préférences commence là où « imite l’exemple » s’arrête : des évaluateurs comparent deux réponses candidates, et une optimisation (RLHF, DPO et leurs cousines) déplace la probabilité vers le genre préféré. C’est ainsi que « décliner et proposer autre chose » peut battre « obéir avec fluidité », alors que les deux sont des continuations grammaticales.
- Les chapitres 1–7 ont construitun continuateur de texte
- Le SFT enseignela forme de la réponse
- Les préférences enseignentles réponses que les gens choisissent
Reste à dire ce que tout cela ne fait pas - et cela compte tout autant. Le pilotage déplace des probabilités ; il n’installe ni vérificateur de vérité ni moteur de règles. L’assistant joue encore le jeu du chapitre 1 à chaque token - voilà pourquoi il peut décliner une insulte et se tromper de date dans le même souffle, et pourquoi les produits réels ajoutent la récupération (aller chercher des documents et les faire lire au modèle dans son contexte) et les outils (le laisser appeler une calculatrice ou un moteur de recherche) plutôt que de faire confiance à des poids figés pour tout savoir. Et les goûts, angles morts et biais des évaluateurs coulent directement dans ce que « préféré » veut dire.
L’alignement est un pilotage, pas une certification. Un modèle ajusté par préférences produit le genre de texte que des évaluateurs ont préféré - une cible mouvante, humaine, imparfaite, corrélée à « utile » et « inoffensif » sans garantir ni l’un ni l’autre. Devant une réponse assurée, le partage des rôles du chapitre 6 tient toujours : la fluidité est le jeu du modèle ; la vérité n’a jamais été la règle du score.
Réfléchissez à ce qui a réellement changé
Point de contrôle
Entre le modèle de base et l’assistant, qu’est-ce qui a réellement changé ?
Reliez tout le voyage
La boucle est bouclée. Un modèle butait jadis sur les « r » de strawberry - vous savez désormais qu’il n’a jamais vu de lettres (chapitre 2). Les adresses sont devenues une géométrie que vous avez traînée à la main (3), le contexte a circulé entre les tokens par une attention tracée score par score (4), un étage complet a empilé position, mélange et transformation (5), un vecteur est devenu un pari puis un token (6), le pari a été entraîné d’absurde à juste sous vos yeux (7), et le continuateur brut vient de finir son école (8). Le chat du chapitre 2 peut prendre sa retraite : chaque nombre entre le texte brut et une réponse polie a désormais une histoire que vous savez raconter - et un instrument que vous pouvez rouvrir, réinitialiser et partager dès que l’histoire demande vérification.
Sources et périmètre
- Ouyang et al. (2022) décrivent la chaîne SFT puis préférences (InstructGPT) que les trois étapes de ce chapitre illustrent, y compris les échecs des modèles de base face aux consignes.
- Rafailov et al. (2023) présentent la Direct Preference Optimization, une méthode répandue pour apprendre de paires de réponses choisies contre rejetées.
- Toutes les continuations et parts de tokens de ce laboratoire sont des fixtures pédagogiques dépeignant des comportements documentés ; aucune n’est une sortie mesurée d’un vrai modèle.
- Contenu et affirmations relus le 18 juillet 2026.