AI ProdigiesCours interactifs
Ouvrir la navigation
Module 3 · Leçon 123 min · debutant

De la phrase aux représentations

Assembler tokenisation et embeddings pour suivre le premier changement de forme subi par une phrase à l’entrée du modèle.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Ordonner tokenisation, identification et embedding
  • Expliquer ce qui est conservé et perdu à chaque transformation

Prérequis

  • Module 2

De la phrase aux représentations

Situation concrète

Pour suivre une phrase dans un LLM, gardons toujours deux questions : quelle est la forme des données maintenant, et quelle opération les transforme ensuite ?

Objectifs d’apprentissage

  • Ordonner tokenisation, identification et embedding
  • Expliquer ce qui est conservé et perdu à chaque transformation

Prérequis

  • Module 2

Mode simple

Le texte brut passe d’abord dans le tokenizer. Chaque unité reçoit un identifiant du vocabulaire. L’identifiant sert d’adresse pour lire une ligne dans la table d’embeddings. Nous obtenons alors un vecteur par position. À ce stade, deux occurrences du même token commencent avec le même embedding, mais elles seront bientôt distinguées par leur position et leur contexte. La phrase n’est donc pas conservée comme une image : elle devient une séquence ordonnée de représentations numériques.

Mode approfondi

Pour une séquence de longueur n et une dimension cachée d, la consultation de la table produit typiquement une matrice n × d. Les tokens spéciaux, la normalisation du texte et le formatage conversationnel peuvent ajouter des positions non visibles dans la phrase affichée. Le tenseur d’entrée est ensuite enrichi ou transformé par un mécanisme de position avant le premier bloc. Conserver les formes permet d’éviter de confondre taille du vocabulaire, longueur de séquence et largeur des états.

Analogie

Un centre de tri remplace chaque colis par une fiche codée, puis aligne les fiches dans l’ordre d’arrivée avant de les transmettre aux ateliers.

Exemple concret

Une phrase de six mots peut produire huit tokens. Avec une largeur d, l’entrée du réseau contient alors huit vecteurs de d coordonnées, pas six définitions de mots.

Les trois formes de l’entrée — Le schéma fait passer la chaîne de caractères à une liste d’identifiants puis à une matrice de vecteurs.

Une phrase devient des blocs de tokens numérotés, puis chaque bloc s’étire en une ligne de petites cases numériques.

Activité manipulable

Manipulez l’activité « tokenization-visualizer », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.
Manipulez l’activité « token-journey », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

L’identifiant d’un token n’est pas une mesure de sens. Un nombre plus grand ne rend pas une unité plus importante.

Vérification rapide

À quoi sert l’identifiant produit par le tokenizer ?

Il indexe une entrée du vocabulaire et permet notamment de récupérer le vecteur d’embedding associé au token.

Résumé

  • Le tokenizer produit une séquence d’identifiants.
  • Chaque identifiant adresse un embedding.
  • La forme devient une matrice longueur par dimension.

Mots du glossaire

Sources

Vue flow

Les trois formes de l’entrée

Le schéma fait passer la chaîne de caractères à une liste d’identifiants puis à une matrice de vecteurs.

Notions associées

  1. pipeline d’entrée
  2. identifiant
  3. embedding

Description de la figure

Une phrase devient des blocs de tokens numérotés, puis chaque bloc s’étire en une ligne de petites cases numériques.

Manipuler pour comprendre

Activité interactive

Activité interactive

Découpage illustratif

Voir une phrase devenir des unités

Modifiez la phrase et comparez deux règles pédagogiques de découpage. Les unités se mettent à jour immédiatement.

Visualiseur de tokenisation au clavier qui affiche une simulation locale et simplifiée, sans présenter le résultat comme celui d’un tokenizer universel.

240 caractères maximum. Les espaces sont utilisés pour la démonstration, mais ne sont pas affichés comme unités séparées.
Sépare visuellement les groupes de lettres, les nombres et la ponctuation.

Découpage de démonstration

5 unités
  1. Les
  2. modèles
  3. apprennent
  4. vite
  5. .

Tout est utilisable au clavier : Tab parcourt le champ et la règle, tandis que les flèches changent l’option du menu.

Activité interactive

8 étapes

Parcours animé d’un token

Fais voyager un token à travers les huit étapes, de la phrase initiale jusqu’au token suivant. Utilise les contrôles ou les flèches gauche et droite.

Étape 1 sur 8, Texte. Une frise présente exactement les étapes texte, token, embedding, position, attention, MLP, logits et token suivant.

Étape 1 sur 8

13 %

Les oiseaux chantent

Transformation 1

Texte

La phrase entre dans le modèle sous forme de caractères lisibles par une personne.

Vérification rapide

Quel ordre correspond au début du parcours d’une phrase ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Embedding

Vecteur initial associé à un token avant les transformations contextuelles.

La table d’embeddings projette un identifiant discret dans un espace continu ; après les couches, l’état dépend aussi des autres tokens et de leur position.

Voir les liens associés
Hidden state

Représentation interne d’un token après une ou plusieurs transformations.

L’état caché est un vecteur contextuel par position ; il évolue à chaque bloc sous l’effet de l’attention, du réseau feed-forward et des connexions résiduelles.

Voir les liens associés
Token

Unité de texte manipulée par le modèle, parfois mot, fragment, signe ou espace.

Le token est un identifiant dans un vocabulaire propre au tokenizer ; sa frontière dépend de l’encodage, de la langue et du modèle considéré.

Voir les liens associés
Tokenizer

Outil qui transforme le texte en identifiants de tokens et effectue l’opération inverse.

Un tokenizer définit normalisation, algorithme de segmentation, vocabulaire et tokens spéciaux ; deux modèles peuvent découper la même chaîne différemment.

Voir les liens associés
RSources de la leçon2 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R20Fait public confirméVérifiée le 2026-07-18

    OpenAI. What are tokens and how to count them? (consulté en 2026).

    Documentation officielle rappelant qu’un token peut être un fragment et que les approximations de comptage dépendent du modèle et de la langue.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.