Des blocs aux logits, puis recommencer
Situation concrète
Après l’entrée et la position, la séquence traverse une pile de blocs. À chaque étage, les positions échangent de l’information puis transforment leur propre état.
Objectifs d’apprentissage
- Décrire le rôle successif des blocs et de la projection finale
- Relier logits, choix du token et nouvelle itération
Prérequis
- Leçon 3.2
Mode simple
Un bloc combine une étape d’attention et une transformation locale MLP, entourées de chemins résiduels et de normalisation. Les vecteurs deviennent progressivement contextuels. Après le dernier bloc, le modèle transforme l’état de la position courante en un score pour chaque token du vocabulaire : les logits. Une règle de décodage choisit une unité. Le système l’ajoute à la séquence et refait le parcours nécessaire pour produire la suivante, jusqu’à un token d’arrêt ou une limite.
Mode approfondi
La pile conserve généralement la forme longueur × dimension cachée, même si les sous-couches projettent temporairement vers d’autres largeurs. Une normalisation finale et une projection linéaire, parfois liée à la matrice d’embeddings, produisent un vecteur de taille vocabulaire. Le décodage opère sur cette distribution et appartient au système de génération plutôt qu’au cœur des poids. Avec un cache KV, les nouveaux états de requête sont calculés sans reconstruire toutes les clés et valeurs passées.
Analogie
Une phrase traverse plusieurs ateliers, puis un jury attribue un score à chaque pièce possible pour décider laquelle ajouter avant le tour suivant.
Exemple concret
Si la sortie est « La capitale de la France est », la projection peut donner un logit élevé à un fragment de « Paris », mais température et contraintes déterminent encore le choix.
Huit étapes numérotées mènent de la phrase aux logits ; une flèche retourne du token choisi vers l’entrée enrichie.
Activité manipulable
Confusion fréquente
Les logits ne sont pas encore des probabilités et ne sont pas eux-mêmes les mots affichés. Ils deviennent une distribution puis un choix de token.
Vérification rapide
Pourquoi faut-il projeter vers le vocabulaire après les blocs ?
Les blocs produisent un vecteur caché. La projection calcule un score par token disponible afin que le système puisse choisir l’unité suivante.
Résumé
- Les blocs rendent chaque état dépendant du contexte.
- La projection finale produit un logit par token.
- Le token choisi rejoint le contexte et déclenche l’itération suivante.
