Dans cette leçon
Les embeddings : le sens devient géométrie
Dans le modèle
Du texte au token suivant
Chaque identifiant ouvre un casier qui contient un vecteur appris. Faites glisser des mots sur une carte jouet et mesurez ce qui se ressemble.
À la fin, vous saurez
- Expliquer comment une table d’embeddings transforme un identifiant en vecteur.
- Interpréter la similarité cosinus sans la confondre avec une mesure de vérité.
Avant de commencer : La tokenisation, ou comment un modèle lit
La leçon précédente s’est terminée sur trois adresses : #120, #18, #901. Une adresse suffit à distinguer avocat de chat, mais sa grandeur ne porte aucun sens : le token #901 n’est pas « plus avocat » que le token #314. Pour calculer des relations utiles, le modèle a besoin d’un objet plus riche qu’un numéro de casier. Commencez par manipuler la géométrie qu’il emploiera.
Observez un vocabulaire devenir une carte
Imaginez une petite carte où chat et chien pointent dans des directions voisines, tandis que pomme part ailleurs. Cette carte n’a pas été apprise par un modèle : elle est dessinée à la main pour isoler la géométrie.
Prédisez le grand voyage du chat
Le classement de l’instrument note la ressemblance de chaque mot avec le token observé. Supposez maintenant qu’on attrape chat et qu’on le traîne jusque chez pomme, à l’autre bout de la carte.
Votre pari
Si chat déménage chez pomme, que devient sa similarité avec chien ?
Personne ne corrige. Engagez-vous, l’instrument tranchera.
Cette petite carte est dessinée à la main. Attrapez un point, faites-le glisser (les curseurs et les flèches du clavier marchent aussi) et regardez le classement cosinus suivre.
| Token | ID | x | y | cosinus |
|---|---|---|---|---|
| #314 | 0.82 | 0.72 | 1.00 | |
| #271 | 0.74 | 0.68 | 1.00 | |
| #408 | 0.34 | 0.86 | 0.89 | |
| #409 | 0.30 | 0.96 | 0.85 | |
| #901 | -0.68 | 0.44 | -0.27 | |
| #612 | -0.78 | 0.32 | -0.44 | |
| #733 | 0.20 | -0.82 | -0.46 | |
| #734 | 0.12 | -0.66 | -0.51 |
Jouet pédagogique : ces huit points ne viennent pas d’un modèle entraîné. Un véritable embedding est appris et possède souvent des centaines de dimensions.
Manipulez les directions
Attrapez un point et faites-le glisser ; la carte et le tableau se recalculent ensemble. Suivez le classement plutôt que la distance à l’écran : le cosinus observe la direction depuis l’origine, pas la position absolue.
Défi Rendez voiture plus proche de reine que de vélo, en un minimum de gestes. Puis cassez tout : trouvez un déplacement d’un seul point qui retourne son cosinus de positif à négatif. Le bouton de réinitialisation pardonne tout.
Ces huit points sont fabriqués à la main ; ils ne proviennent pas de la projection d’un modèle entraîné. Une véritable table d’embeddings est apprise et possède souvent des centaines ou des milliers de dimensions. Ses axes n’arrivent pas avec des étiquettes humaines comme « animal » ou « royal » : les régularités utiles se répartissent dans de nombreuses directions.
Expliquez la mécanique de la table
En 2013, des chercheurs ont montré que certains écarts entre vecteurs de mots appris capturaient des relations récurrentes. Le raccourci devenu célèbre était roi − homme + femme ≈ reine. C’est un exemple frappant, pas une loi algébrique : le résultat dépend du modèle et de ses données d’entraînement.
- Identifiant du tokenavocat · #901
- Recherche dans la tableE[901]
- Vecteur de départ[−0,68 ; 0,44]
Une table d’embeddings est une matrice E avec une ligne par token. Pour l’identifiant i, E[i] renvoie le vecteur eᵢ. Pendant l’entraînement, les valeurs de E sont ajustées chaque fois que cela aide le modèle à mieux prédire le token suivant.
Pour comparer deux vecteurs, l’instrument utilise la similarité cosinus : un score qui ne regarde que la direction, jamais la longueur. Une valeur proche de 1 signifie « directions proches » dans cet espace appris ; elle ne signifie pas « mots identiques » ni « affirmation vraie ». Au point [0, 0], il n’existe aucune direction : la similarité cosinus est indéfinie, et le laboratoire l’indique au lieu d’inventer un zéro.
Le même score, en formules
cos(a, b) = (a · b) / (||a|| × ||b||)
Le produit scalaire a · b augmente quand les directions s’alignent ; la division par les deux longueurs retire l’échelle, et seul l’angle survit.
Il manque encore le contexte. Pour un même identifiant du token avocat, la table renvoie la même ligne dans « manger un avocat » et « appeler un avocat ». L’embedding initial porte des régularités apprises, avec les imperfections et biais des données d’entraînement ; il n’exprime pas encore le rôle précis de cette occurrence. Gardez ces deux phrases en tête : elles ouvrent le chapitre 4.
Réfléchissez à ce que dit un cosinus
Point de contrôle
Les lignes E[271] et E[314] ont des longueurs différentes, mais pointent presque dans la même direction. Que conclure ?
Reliez le vecteur fixe à sa phrase
Nous avons maintenant un vecteur de départ par token, mais chaque recherche ignore superbement la phrase qui l’entoure : le vecteur d’avocat ne sait pas s’il est question de guacamole ou de tribunal. Dans la prochaine leçon, ce même vecteur initial entrera dans deux contextes et produira deux sorties différentes. Il est temps de faire parler les tokens entre eux.
Sources et périmètre
- Mikolov, Yih et Zweig (2013) décrivent des écarts syntaxiques et sémantiques récurrents dans des espaces de vecteurs de mots appris.
- Les huit points 2D du laboratoire sont fabriqués pour enseigner la recherche dans une table et la géométrie du cosinus ; ils ne proviennent pas d’un modèle de langage entraîné.
- Contenu et affirmations relus le 18 juillet 2026.