AI ProdigiesCours interactifs
Ouvrir la navigation
Module 3 · Leçon 328 min · intermediaire

Des blocs aux logits, puis recommencer

Suivre les états à travers les blocs, la projection vers le vocabulaire et la boucle qui ajoute chaque nouveau token.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Décrire le rôle successif des blocs et de la projection finale
  • Relier logits, choix du token et nouvelle itération

Prérequis

  • Leçon 3.2

Des blocs aux logits, puis recommencer

Situation concrète

Après l’entrée et la position, la séquence traverse une pile de blocs. À chaque étage, les positions échangent de l’information puis transforment leur propre état.

Objectifs d’apprentissage

  • Décrire le rôle successif des blocs et de la projection finale
  • Relier logits, choix du token et nouvelle itération

Prérequis

  • Leçon 3.2

Mode simple

Un bloc combine une étape d’attention et une transformation locale MLP, entourées de chemins résiduels et de normalisation. Les vecteurs deviennent progressivement contextuels. Après le dernier bloc, le modèle transforme l’état de la position courante en un score pour chaque token du vocabulaire : les logits. Une règle de décodage choisit une unité. Le système l’ajoute à la séquence et refait le parcours nécessaire pour produire la suivante, jusqu’à un token d’arrêt ou une limite.

Mode approfondi

La pile conserve généralement la forme longueur × dimension cachée, même si les sous-couches projettent temporairement vers d’autres largeurs. Une normalisation finale et une projection linéaire, parfois liée à la matrice d’embeddings, produisent un vecteur de taille vocabulaire. Le décodage opère sur cette distribution et appartient au système de génération plutôt qu’au cœur des poids. Avec un cache KV, les nouveaux états de requête sont calculés sans reconstruire toutes les clés et valeurs passées.

Analogie

Une phrase traverse plusieurs ateliers, puis un jury attribue un score à chaque pièce possible pour décider laquelle ajouter avant le tour suivant.

Exemple concret

Si la sortie est « La capitale de la France est », la projection peut donner un logit élevé à un fragment de « Paris », mais température et contraintes déterminent encore le choix.

Le voyage complet d’une génération — Une frise traverse entrée, position, blocs répétés, projection, décodage, ajout et boucle suivante.

Huit étapes numérotées mènent de la phrase aux logits ; une flèche retourne du token choisi vers l’entrée enrichie.

Activité manipulable

Manipulez l’activité « token-journey », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

Les logits ne sont pas encore des probabilités et ne sont pas eux-mêmes les mots affichés. Ils deviennent une distribution puis un choix de token.

Vérification rapide

Pourquoi faut-il projeter vers le vocabulaire après les blocs ?

Les blocs produisent un vecteur caché. La projection calcule un score par token disponible afin que le système puisse choisir l’unité suivante.

Résumé

  • Les blocs rendent chaque état dépendant du contexte.
  • La projection finale produit un logit par token.
  • Le token choisi rejoint le contexte et déclenche l’itération suivante.

Mots du glossaire

Sources

Vue flow

Le voyage complet d’une génération

Une frise traverse entrée, position, blocs répétés, projection, décodage, ajout et boucle suivante.

Notions associées

  1. bloc Transformer
  2. état caché
  3. logit

Description de la figure

Huit étapes numérotées mènent de la phrase aux logits ; une flèche retourne du token choisi vers l’entrée enrichie.

Manipuler pour comprendre

Activité interactive

Activité interactive

8 étapes

Parcours animé d’un token

Fais voyager un token à travers les huit étapes, de la phrase initiale jusqu’au token suivant. Utilise les contrôles ou les flèches gauche et droite.

Étape 1 sur 8, Texte. Une frise présente exactement les étapes texte, token, embedding, position, attention, MLP, logits et token suivant.

Étape 1 sur 8

13 %

Les oiseaux chantent

Transformation 1

Texte

La phrase entre dans le modèle sous forme de caractères lisibles par une personne.

Vérification rapide

Quelles étapes suivent normalement les derniers états cachés ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Autorégressif

Qui produit la suite une unité après l’autre en utilisant les unités déjà présentes.

Un modèle autorégressif factorise la probabilité d’une séquence en probabilités conditionnelles successives et applique un masque causal pendant l’apprentissage.

Voir les liens associés
Hidden state

Représentation interne d’un token après une ou plusieurs transformations.

L’état caché est un vecteur contextuel par position ; il évolue à chaque bloc sous l’effet de l’attention, du réseau feed-forward et des connexions résiduelles.

Voir les liens associés
Logit

Score brut attribué à un token avant sa conversion en probabilité.

Les logits sont les sorties non normalisées de la projection vers le vocabulaire ; seules leurs différences influencent la distribution produite par softmax.

Voir les liens associés
Vocabulaire de sortie

Ensemble des tokens auxquels le modèle attribue un score pour choisir la suite.

La projection finale produit un logit par entrée du vocabulaire, souvent avec des poids liés à la table d’embeddings selon l’architecture.

Voir les liens associés
RSources de la leçon3 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R3Source primaireVérifiée le 2026-07-18

    Radford, A. et al.. Language Models are Unsupervised Multitask Learners (2019).

    Rapport GPT-2 utile pour la prédiction autorégressive et l’apparition de capacités sans entraînement spécifique par tâche.

    Consulter la source dans un nouvel onglet
  3. R5Source primaireVérifiée le 2026-07-18

    OpenAI. GPT-4 Technical Report (2023, version mise à jour 2024).

    Source officielle qui confirme l’objectif de prochain token tout en déclarant non publiés les détails précis d’architecture et d’entraînement.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.