AI ProdigiesCours interactifs
Ouvrir la navigation
Module 4 · Leçon 126 min · intermediaire

Ouvrir un bloc Transformer

Identifier les chemins de calcul d’un bloc et comprendre pourquoi attention et MLP remplissent deux fonctions complémentaires.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Repérer attention, MLP, résidus et normalisations
  • Expliquer la complémentarité entre échange et transformation locale

Prérequis

  • Module 3

Ouvrir un bloc Transformer

Situation concrète

Un Transformer n’est pas un seul calcul d’attention. Il répète des blocs où l’information circule entre positions puis se transforme à l’intérieur de chaque position.

Objectifs d’apprentissage

  • Repérer attention, MLP, résidus et normalisations
  • Expliquer la complémentarité entre échange et transformation locale

Prérequis

  • Module 3

Mode simple

L’attention permet à un token de prendre en compte d’autres tokens autorisés. Le MLP transforme ensuite chaque position séparément. Une connexion résiduelle ajoute l’entrée au résultat au lieu de tout remplacer, et une normalisation garde des échelles favorables au calcul. Selon l’architecture, la normalisation se place avant ou après la sous-couche et peut utiliser LayerNorm ou RMSNorm. Le schéma général reste utile, mais les détails ne sont pas universels.

Mode approfondi

Un bloc décodeur moderne suit souvent une variante pré-norm : x devient x plus Attention(Norm(x)), puis ce résultat plus MLP(Norm(.)), même si d’autres ordres existent. Les résidus fournissent un chemin d’identité qui facilite l’optimisation de piles profondes. Le MLP peut élargir fortement la dimension et utiliser ReLU, GELU ou des portes telles que SwiGLU. La normalisation contrôle l’échelle des activations sans imposer que tous les modèles emploient la même formule.

Analogie

Dans une réunion, l’attention collecte des informations auprès des autres ; le MLP correspond au travail individuel effectué ensuite ; le chemin résiduel conserve les notes d’origine.

Exemple concret

Pour le pronom « elle », l’attention peut récupérer un antécédent. La transformation locale peut ensuite exploiter cette information pour préparer les prédictions suivantes.

Les deux sous-couches et leurs raccourcis — Le signal se divise entre transformation et chemin direct, se rejoint, est normalisé puis traverse le second sous-bloc.

Deux boucles résiduelles entourent successivement attention et MLP, avec des nœuds de normalisation clairement identifiés.

Activité manipulable

Manipulez l’activité « residual-normalization », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

Le MLP n’est pas un bloc de mémoire documentaire et la normalisation n’efface pas le contenu pour mettre toutes les valeurs à zéro.

Vérification rapide

Quelle différence essentielle sépare attention et MLP ?

L’attention mélange des informations entre positions. Le MLP applique la même famille de transformation à chaque position séparément.

Résumé

  • Un bloc associe échange global et transformation locale.
  • Les résidus conservent un chemin direct.
  • Ordre et type de normalisation varient selon l’architecture.

Mots du glossaire

Sources

Vue flow

Les deux sous-couches et leurs raccourcis

Le signal se divise entre transformation et chemin direct, se rejoint, est normalisé puis traverse le second sous-bloc.

Notions associées

  1. bloc Transformer
  2. résidu
  3. normalisation
  4. MLP

Description de la figure

Deux boucles résiduelles entourent successivement attention et MLP, avec des nœuds de normalisation clairement identifiés.

Manipuler pour comprendre

Activité interactive

Activité interactive

Analogie numérique simplifiée

Atelier résiduel et normalisation

Modifie les deux chemins, puis identifie le rôle de la connexion résiduelle.

Deux chemins numériques se rejoignent par addition, puis leur somme est remise à l’échelle pour illustrer une normalisation.

Résultat d’une transformation pédagogique.

Signal d’entrée conservé par le raccourci.

Somme : 5

Valeur stabilisée : 1.67

Quel est le rôle principal du chemin résiduel ?

Vérification rapide

Quel énoncé sépare correctement attention et MLP dans un bloc ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Feed-forward

Bloc qui transforme séparément chaque position après l’échange d’informations par attention.

Le réseau feed-forward applique typiquement deux projections et une non-linéarité à chaque position, avec des variantes d’activation et de largeur selon l’architecture.

Voir les liens associés
LayerNorm

Méthode qui recentre et remet à l’échelle les activations d’une position.

Layer Normalization normalise les coordonnées d’un exemple indépendamment du batch, puis applique des paramètres d’échelle et de biais appris.

Voir les liens associés
Résiduel

Connexion qui ajoute l’entrée d’une sous-couche à sa transformation.

Une connexion résiduelle crée un chemin direct pour l’information et les gradients ; son placement par rapport à la normalisation varie selon les architectures.

Voir les liens associés
RMSNorm

Normalisation fondée sur la racine de la moyenne des carrés.

RMSNorm remet l’échelle d’un vecteur à partir de sa norme quadratique moyenne sans soustraire explicitement sa moyenne, ce qui réduit certaines opérations de LayerNorm.

Voir les liens associés
Transformer

Architecture qui traite les relations entre positions grâce à l’attention et à des blocs répétés.

Le Transformer original combine attention, réseaux feed-forward, positions, résidus et normalisation ; les LLM modernes en utilisent de nombreuses variantes.

Voir les liens associés
RSources de la leçon2 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R10Source primaireVérifiée le 2026-07-18

    Zhang, B. et Sennrich, R.. Root Mean Square Layer Normalization (2019).

    Source de RMSNorm, utile pour comparer les objectifs et calculs des variantes de normalisation dans les réseaux profonds.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.