Verbatome / Chapitre 05Contexte → bloc14 min de lecture

Dans cette leçon

Le bloc Transformer, l’étage que l’on empile

Un étage complet : positions, normalisation, attention, MLP et flux résiduel - avec une expérience exacte sur ce que le bloc fait de l’ordre des mots.

À la fin, vous saurez

  • Tracer un vecteur à travers positions, normalisation, attention, MLP et les deux additions résiduelles.
  • Expliquer pourquoi un Transformer a besoin d’une information de position.

Avant de commencer : L’attention, le moment où les tokens se parlent

Le chien mord l’homme. L’homme mord le chien. Mêmes mots, mais un seul des deux fait la une. Rappelez-vous maintenant ce que vous avez construit au chapitre 4 : l’attention compare des requêtes et des clés par produits scalaires, et rien - littéralement rien - dans un produit scalaire ne sait se trouve un token. Que fait donc de l’ordre des mots le mécanisme qui fait parler les tokens ? Avant de l’empiler dans un vrai modèle, la question mérite une réponse exacte - et, si la réponse vous inquiète, un correctif.

Observez l’angle mort de la machine

Un Transformer est une tour d’étages identiques, et ce chapitre parcourt un étage entier : ajouter les vecteurs de position, normaliser, faire jouer l’attention, réinjecter le résultat, normaliser encore, transformer chaque token par un petit réseau, réinjecter à nouveau. L’instrument ci-dessous fait passer le même mot par le même étage deux fois - dans l’ordre original, puis dans l’ordre inversé. Toute différence entre les deux passages ne peut venir que de l’ordre.

Prédisez l’effet du mélange

Laissez les vecteurs de position désactivés. Le token suivi, avocat, termine « manger un avocat » et ouvre la phrase inversée.

Votre pari

Positions désactivées : que fait l’inversion de l’ordre à la sortie du bloc pour avocat ?

Personne ne corrige. Engagez-vous, l’instrument tranchera.

Explorateur de bloc / un étage complet

Le même mot traverse le même bloc dans deux ordres de phrase. Activez ou non les vecteurs de position, et mesurez ce que le bloc voit - ou pas.

Ordre original

mangerunavocat

position
p2
vecteur ajouté
aucun
sortie du bloc
[-1.197, 1.385]

Ordre inversé

avocatunmanger

position
p0
vecteur ajouté
aucun
sortie du bloc
[-1.197, 1.385]

Sorties identiques : sans positions, le bloc traite la phrase comme un sac de mots.

Inspecter l’étage complet (ordre original)
avocat · #901
ÉtapeVecteur
Embedding d’entrée[-0.680, 0.440]
+ vecteur de position[-0.680, 0.440]
RMSNorm (avant attention)[-1.187, 0.768]
Mélange d’attention[-0.517, 0.243]
+ résidu (flux + attention)[-1.197, 0.683]
RMSNorm (avant MLP)[-1.228, 0.701]
MLP (2 → 3 → 2, ReLU)[0.000, 0.701]
+ résidu = sortie du bloc[-1.197, 1.385]
Poids d’attention (sans masque, dans ce laboratoire)
Q ↓ / K →mangerunavocat
manger0.4820.4820.036
un0.4820.4820.036
avocat0.0650.0650.871

Chaque ligne totalise 1. Le masque causal du chapitre 4 reste utilisé dans un vrai décodeur ; il est retiré ici pour que l’expérience d’ordre soit exacte.

Manipulez l’étage

Si vous avez parié « identique », vous venez de vérifier ce que la plupart des explications passent sous silence : l’étage entier - attention, normalisation, MLP, résidus - est équivariant par permutation. Mélangez la phrase : la sortie de chaque mot le suit, inchangée jusqu’à la dernière décimale.

Activez maintenant les vecteurs de position. Chaque place ajoute son petit vecteur (p0, p1, p2) au token qui l’occupe, avant toute autre opération. Les deux passages divergent aussitôt : l’ordre est entré dans le calcul sous forme de géométrie. Ouvrez l’inspecteur et suivez les huit étapes ; remarquez la sortie du MLP pour la cible - sa première coordonnée vaut exactement 0.000, coupée par la ReLU, la porte max(0, z) définie plus bas : petite cicatrice honnête de la façon dont ces réseaux calculent.

Défi Deux missions. Un : positions activées, suivez le mot du milieu, un. Inverser une phrase de trois mots laisse le milieu en place : il reçoit le même vecteur de position dans les deux passages - et pourtant sa sortie change. Expliquez par où la différence s’infiltre. Deux : dans la matrice des poids, chaque ligne totalise exactement 1. Dites quel ingrédient du chapitre 4 le garantit.

Expliquez le plan de l’étage

Voici l’étage dans l’ordre, et ce qui justifie chaque pièce :

  • Les vecteurs de position impriment « tu es en place 2 » dans la géométrie du token, car rien en aval ne peut voir l’ordre autrement.
  • RMSNorm ramène chaque vecteur à une taille standard avant chaque sous-couche - après des dizaines d’étages, des valeurs libres dériveraient vers l’immense ou le minuscule. Elle remet à l’échelle sans recentrer : la direction survit.
  • L’attention est la seule étape où les positions échangent de l’information ; vous l’avez construite au chapitre 4.
  • Le MLP (un petit perceptron multicouche) est son complément : il ne regarde jamais de côté. Chaque token, seul, est dilaté (2 → 3 ici), passé par une ReLU qui ne garde que les indices positifs, puis recontracté (3 → 2). Les vrais modèles dilatent environ quatre fois, sur des milliers de dimensions.
  • Les additions résiduelles sont le coup de maître discret. Le bloc ne remplace pas le vecteur du token ; il l’amende : sortie = entrée + correction, deux fois par étage. Ce total courant s’appelle le flux résiduel, et c’est lui qui permet d’empiler des dizaines d’étages sans dissoudre le signal.
  1. Le chapitre 4 a construitl’attention : les tokens se parlent
  2. Cet étage ajoutepositions · norme · MLP · résidus
  3. Un vrai modèle empileN × cet étage
Le même étage, en formules

RMSNorm ramène un vecteur x à x / √(moyenne(x²)) : sa moyenne quadratique devient 1, sa direction est préservée (les vrais modèles multiplient ensuite par un petit gain appris).

Le MLP calcule W₂ · ReLU(W₁x + b₁) + b₂, avec ReLU(z) = max(0, z).

Un étage pré-normalisé, écrit comme des amendements au flux résiduel h :

h ← h + Attention(RMSNorm(h)) h ← h + MLP(RMSNorm(h))

Ce laboratoire ajoute des vecteurs de position écrits à la main. Les modèles de production apprennent leurs encodages de position ou font tourner Q et K selon la position (RoPE) ; la raison d’être est la même.

Aucune pièce n’est « l’endroit où le modèle pense ». L’attention déplace l’information entre les positions ; le MLP la transforme sur place ; ils alternent, étage après étage. Et un vrai décodeur garde le masque causal du chapitre 4 dans chaque étage - ce laboratoire le retire uniquement pour que l’expérience d’ordre soit mathématiquement exacte.

Réfléchissez au sac de mots

Point de contrôle

Positions désactivées (et sans masque), inverser la phrase laisse la sortie de chaque mot inchangée. Pourquoi ?

Positions désactivées (et sans masque), inverser la phrase laisse la sortie de chaque mot inchangée. Pourquoi ?

Reliez l’étage à la tour

La trace du cours vient de franchir un étage complet : la cible est entrée avec la ligne du chapitre 3, [−0,68 ; 0,44], et en ressort grandie, remodelée par ses voisins, les positions et le MLP. Un vrai modèle répète cet étage des dizaines de fois, avec plusieurs têtes d’attention par étage, avant de dire quoi que ce soit à voix haute. Reste la dernière question mécanique : au sommet de la tour, il y a un vecteur - et le lecteur attend un mot. Transformer ce vecteur en pari sur tout le vocabulaire, puis en token choisi, c’est le prochain chapitre.

Sources et périmètre
  • Vaswani et al. (2017) définissent le bloc Transformer : attention plus réseau feed-forward par position, connexions résiduelles et normalisation.
  • Zhang et Sennrich (2019) introduisent RMSNorm, la normalisation sans recentrage utilisée dans ce laboratoire et dans de nombreux modèles récents.
  • Su et al. (2021) présentent les positions rotatives (RoPE), l’alternative de production aux vecteurs additifs montrés ici.
  • L’étage est un bloc 2D fabriqué à la main avec un MLP à 3 unités ; l’attention y tourne sans masque pour que l’expérience de permutation soit exacte.
  • Contenu et affirmations relus le 18 juillet 2026.