Ouvrir un bloc Transformer
Situation concrète
Un Transformer n’est pas un seul calcul d’attention. Il répète des blocs où l’information circule entre positions puis se transforme à l’intérieur de chaque position.
Objectifs d’apprentissage
- Repérer attention, MLP, résidus et normalisations
- Expliquer la complémentarité entre échange et transformation locale
Prérequis
- Module 3
Mode simple
L’attention permet à un token de prendre en compte d’autres tokens autorisés. Le MLP transforme ensuite chaque position séparément. Une connexion résiduelle ajoute l’entrée au résultat au lieu de tout remplacer, et une normalisation garde des échelles favorables au calcul. Selon l’architecture, la normalisation se place avant ou après la sous-couche et peut utiliser LayerNorm ou RMSNorm. Le schéma général reste utile, mais les détails ne sont pas universels.
Mode approfondi
Un bloc décodeur moderne suit souvent une variante pré-norm : x devient x plus Attention(Norm(x)), puis ce résultat plus MLP(Norm(.)), même si d’autres ordres existent. Les résidus fournissent un chemin d’identité qui facilite l’optimisation de piles profondes. Le MLP peut élargir fortement la dimension et utiliser ReLU, GELU ou des portes telles que SwiGLU. La normalisation contrôle l’échelle des activations sans imposer que tous les modèles emploient la même formule.
Analogie
Dans une réunion, l’attention collecte des informations auprès des autres ; le MLP correspond au travail individuel effectué ensuite ; le chemin résiduel conserve les notes d’origine.
Exemple concret
Pour le pronom « elle », l’attention peut récupérer un antécédent. La transformation locale peut ensuite exploiter cette information pour préparer les prédictions suivantes.
Deux boucles résiduelles entourent successivement attention et MLP, avec des nœuds de normalisation clairement identifiés.
Activité manipulable
Confusion fréquente
Le MLP n’est pas un bloc de mémoire documentaire et la normalisation n’efface pas le contenu pour mettre toutes les valeurs à zéro.
Vérification rapide
Quelle différence essentielle sépare attention et MLP ?
L’attention mélange des informations entre positions. Le MLP applique la même famille de transformation à chaque position séparément.
Résumé
- Un bloc associe échange global et transformation locale.
- Les résidus conservent un chemin direct.
- Ordre et type de normalisation varient selon l’architecture.
