De la phrase aux représentations
Situation concrète
Pour suivre une phrase dans un LLM, gardons toujours deux questions : quelle est la forme des données maintenant, et quelle opération les transforme ensuite ?
Objectifs d’apprentissage
- Ordonner tokenisation, identification et embedding
- Expliquer ce qui est conservé et perdu à chaque transformation
Prérequis
- Module 2
Mode simple
Le texte brut passe d’abord dans le tokenizer. Chaque unité reçoit un identifiant du vocabulaire. L’identifiant sert d’adresse pour lire une ligne dans la table d’embeddings. Nous obtenons alors un vecteur par position. À ce stade, deux occurrences du même token commencent avec le même embedding, mais elles seront bientôt distinguées par leur position et leur contexte. La phrase n’est donc pas conservée comme une image : elle devient une séquence ordonnée de représentations numériques.
Mode approfondi
Pour une séquence de longueur n et une dimension cachée d, la consultation de la table produit typiquement une matrice n × d. Les tokens spéciaux, la normalisation du texte et le formatage conversationnel peuvent ajouter des positions non visibles dans la phrase affichée. Le tenseur d’entrée est ensuite enrichi ou transformé par un mécanisme de position avant le premier bloc. Conserver les formes permet d’éviter de confondre taille du vocabulaire, longueur de séquence et largeur des états.
Analogie
Un centre de tri remplace chaque colis par une fiche codée, puis aligne les fiches dans l’ordre d’arrivée avant de les transmettre aux ateliers.
Exemple concret
Une phrase de six mots peut produire huit tokens. Avec une largeur d, l’entrée du réseau contient alors huit vecteurs de d coordonnées, pas six définitions de mots.
Une phrase devient des blocs de tokens numérotés, puis chaque bloc s’étire en une ligne de petites cases numériques.
Activité manipulable
Confusion fréquente
L’identifiant d’un token n’est pas une mesure de sens. Un nombre plus grand ne rend pas une unité plus importante.
Vérification rapide
À quoi sert l’identifiant produit par le tokenizer ?
Il indexe une entrée du vocabulaire et permet notamment de récupérer le vecteur d’embedding associé au token.
Résumé
- Le tokenizer produit une séquence d’identifiants.
- Chaque identifiant adresse un embedding.
- La forme devient une matrice longueur par dimension.
