AI ProdigiesCours interactifs
Ouvrir la navigation
Module 2 · Leçon 225 min · intermediaire

Embeddings et proximités

Passer d’un identifiant de token à un vecteur et interpréter les proximités comme des régularités apprises, non comme un dictionnaire parfait.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Expliquer le rôle de la table d’embeddings
  • Interpréter avec prudence une carte de proximité en deux dimensions

Prérequis

  • Leçon 2.1

Embeddings et proximités

Situation concrète

Un identifiant comme 4 217 ne dit rien par lui-même sur un token. Le modèle le remplace par une longue liste de coordonnées qui peut participer à de nombreux calculs.

Objectifs d’apprentissage

  • Expliquer le rôle de la table d’embeddings
  • Interpréter avec prudence une carte de proximité en deux dimensions

Prérequis

  • Leçon 2.1

Mode simple

Un embedding est une fiche de nombres associée à un token. Pendant l’entraînement, les fiches sont ajustées avec le reste du modèle. Des unités utilisées dans des situations proches développent souvent des relations mesurables, ce qui autorise des cartes pédagogiques. Mais la vraie fiche possède beaucoup plus de deux dimensions, et le sens final d’un token change après avoir rencontré son contexte dans les couches.

Mode approfondi

La table d’embeddings est une matrice indexée par les identifiants du vocabulaire. Une ligne fournit le vecteur d’entrée, éventuellement combiné à une information de position. La géométrie encode des régularités distribuées, sans garantir qu’une distance unique capture toutes les relations sémantiques. Une projection 2D déforme inévitablement certaines distances ; les états contextuels des couches supérieures ne se réduisent pas non plus à cette table statique.

Analogie

Une fiche de bibliothèque possède plusieurs rubriques : sujet, époque, style et public. Deux livres peuvent être proches sur une rubrique et éloignés sur une autre.

Exemple concret

« chat » et « chien » peuvent partager des contextes liés aux animaux, tandis que « chat » au sens de conversation en ligne exige le contexte pour désambiguïser l’usage.

Projection d’un espace d’embeddings — Une carte affiche des concepts, leurs distances illustratives et un avertissement sur la perte d’information lors de la projection.

Des points de concepts sont regroupés sur un plan ; une note précise que le plan simplifie un espace de grande dimension.

Activité manipulable

Manipulez l’activité « embedding-map », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

Un point proche sur une carte 2D ne démontre pas que deux mots ont le même sens. La métrique, la projection et le contexte comptent.

Vérification rapide

Pourquoi l’embedding initial ne suffit-il pas à représenter le sens dans une phrase ?

Il est associé au token avant le contexte. Les couches suivantes produisent un état caché qui dépend des autres positions et de leur ordre.

Résumé

  • L’embedding transforme un identifiant en vecteur.
  • La proximité reflète des régularités, pas des définitions fixes.
  • Une carte 2D perd une partie de la géométrie réelle.

Mots du glossaire

Sources

Vue map

Projection d’un espace d’embeddings

Une carte affiche des concepts, leurs distances illustratives et un avertissement sur la perte d’information lors de la projection.

Notions associées

  1. embedding
  2. vecteur
  3. distance

Description de la figure

Des points de concepts sont regroupés sur un plan ; une note précise que le plan simplifie un espace de grande dimension.

Manipuler pour comprendre

Activité interactive

Activité interactive

Projection 2D simplifiée

Une carte pour raisonner sur les embeddings

Sélectionnez un concept, déplacez-le avec les flèches du clavier ou les boutons, puis observez comment ses distances changent.

Carte interactive accessible de cinq concepts dans une projection bidimensionnelle simplifiée, avec sélection, déplacement au clavier et lecture numérique des distances.

axe illustratif Yaxe illustratif X
Projection illustrative : les coordonnées et les distances affichées changent réellement à chaque déplacement. Au clavier : choisissez un point avec Tab etEntrée, puis utilisez les quatre flèches pour le déplacer. La carte elle-même peut aussi recevoir le focus.

Vérification rapide

Quel avertissement accompagne une carte d’embeddings en deux dimensions ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Dimension cachée

Nombre de coordonnées utilisées dans la représentation interne d’un token.

La dimension cachée fixe la largeur principale des états du Transformer ; elle ne doit pas être confondue avec le nombre de couches, de têtes ou de paramètres.

Voir les liens associés
Embedding

Vecteur initial associé à un token avant les transformations contextuelles.

La table d’embeddings projette un identifiant discret dans un espace continu ; après les couches, l’état dépend aussi des autres tokens et de leur position.

Voir les liens associés
Superposition

Situation où plusieurs caractéristiques partagent les mêmes dimensions internes.

La superposition permet à un réseau de représenter davantage de caractéristiques que ses axes directement lisibles, ce qui complique l’interprétation neurone par neurone.

Voir les liens associés
RSources de la leçon3 références, avec portée et date de vérification
  1. R18Source primaireVérifiée le 2026-07-18

    Elhage, N. et al.. Toy Models of Superposition (2022).

    Travail sur modèles jouets montrant comment plusieurs caractéristiques peuvent partager des dimensions, sans généralisation automatique à tous les LLM de production.

    Consulter la source dans un nouvel onglet
  2. R19Source primaireVérifiée le 2026-07-18

    Bricken, T. et al.. Towards Monosemanticity: Decomposing Language Models With Dictionary Learning (2023).

    Preuve de concept sur un Transformer d’une couche avec MLP de 512 neurones, utile pour dépasser l’idée naïve d’un neurone égal à un concept sans promettre l’interprétabilité complète des grands modèles.

    Consulter la source dans un nouvel onglet
  3. R27Source primaireVérifiée le 2026-07-18

    Bengio, Y. et al.. A Neural Probabilistic Language Model (2003).

    Jalon historique des modèles de langue neuronaux et de l’apprentissage de représentations distribuées des mots.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.