AI ProdigiesCours interactifs
Ouvrir la navigation
Module 3 · Leçon 227 min · intermediaire

Donner une position aux tokens

Comprendre pourquoi l’ordre doit entrer dans le calcul et comparer positions apprises, RoPE et biais ALiBi sans les confondre.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Expliquer pourquoi l’attention seule a besoin d’information de position
  • Comparer plusieurs familles d’encodage positionnel

Prérequis

  • Leçon 3.1

Donner une position aux tokens

Situation concrète

« Le chien mord le facteur » et « le facteur mord le chien » contiennent presque les mêmes unités, mais leurs relations changent avec l’ordre.

Objectifs d’apprentissage

  • Expliquer pourquoi l’attention seule a besoin d’information de position
  • Comparer plusieurs familles d’encodage positionnel

Prérequis

  • Leçon 3.1

Mode simple

Le modèle doit savoir où chaque token se trouve et comment les positions se rapportent. Le Transformer original ajoutait des motifs numériques de position aux embeddings. D’autres modèles apprennent des positions, font tourner les requêtes et clés avec RoPE, ou ajoutent un biais lié à la distance avec ALiBi. Ces solutions ne stockent pas toutes l’ordre de la même façon, mais elles donnent au calcul un moyen de distinguer une séquence réordonnée.

Mode approfondi

Sans signal positionnel, une auto-attention pure est équivariante aux permutations : réordonner les entrées réordonne les sorties sans révéler l’ordre original. Les encodages sinusoïdaux ajoutent un vecteur déterministe ; RoPE applique des rotations dépendantes de la position à Q et K, faisant intervenir les écarts dans leur produit ; ALiBi ajoute un biais monotone aux scores. Les comportements hors longueur d’entraînement et les détails de mise à l’échelle dépendent de l’implémentation.

Analogie

Les mots sont des acteurs ; la position est le marquage au sol qui indique qui se tient avant, après ou loin d’un autre acteur.

Exemple concret

En déplaçant « seulement » dans une phrase, on change ce qui est limité. L’activité fait varier l’ordre sans changer le stock de mots pour isoler cet effet.

Trois façons d’indiquer la position — Une comparaison présente ajout de vecteurs, rotations RoPE et biais ALiBi avec l’endroit où chacun intervient.

Trois colonnes montrent respectivement une addition à l’entrée, une rotation des requêtes et clés, et un malus sur les scores selon la distance.

Activité manipulable

Manipulez l’activité « word-order-challenge », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

RoPE n’est pas une simple colonne ajoutée à l’embedding, et ALiBi ne fait pas tourner les vecteurs. Les regrouper sous « position » ne les rend pas interchangeables.

Vérification rapide

Que perdrait un mécanisme sans aucune information de position ?

Il ne pourrait pas distinguer correctement des séquences qui contiennent les mêmes représentations mais dans un ordre différent.

Résumé

  • L’ordre doit être rendu accessible au calcul.
  • Plusieurs méthodes injectent la position à des endroits différents.
  • La distance et la longueur maximale exigent des nuances d’implémentation.

Mots du glossaire

Sources

Vue comparison

Trois façons d’indiquer la position

Une comparaison présente ajout de vecteurs, rotations RoPE et biais ALiBi avec l’endroit où chacun intervient.

Notions associées

  1. ordre
  2. position
  3. RoPE
  4. ALiBi

Description de la figure

Trois colonnes montrent respectivement une addition à l’entrée, une rotation des requêtes et clés, et un malus sur les scores selon la distance.

Manipuler pour comprendre

Activité interactive

Activité interactive

Position des tokens

Défi sur l’ordre des mots

Remets les cinq mots dans l’ordre pour former « Le chien suit le chat ». Sélectionne un mot, puis déplace-le avec les boutons ou les flèches du clavier.

L’ordre actuel est : suit chat Le chien le. Chaque mot est un bouton déplaçable vers la gauche ou la droite. Une phrase de comparaison montre que les mêmes mots peuvent attribuer des rôles différents.

Phrase à reconstruire

Qui suit qui ?

0/5 bien placé

Sélectionne d’abord un mot.

Comparaison du sens

Le chien suit le chat.

Le chien est celui qui se déplace derrière le chat.

Le chat suit le chien.

Les mêmes mots nomment les mêmes êtres, mais leurs rôles sont inversés.

Un embedding de token seul n’indique pas sa place. Le Transformer lui ajoute une information de position afin que l’attention puisse tenir compte de l’ordre.

Vérification rapide

Sans information de position, l’auto-attention pure distingue automatiquement toutes les permutations d’une même collection d’entrées.

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
ALiBi

Méthode qui ajoute dans l’attention un malus lorsque deux tokens sont éloignés.

ALiBi ajoute aux scores d’attention un biais linéaire propre à chaque tête et proportionnel à la distance, sans créer d’embedding positionnel appris séparé.

Voir les liens associés
Attention

Calcul qui mesure quels tokens sont utiles pour mettre à jour la représentation d’un autre token.

L’attention compare requêtes et clés, applique une normalisation aux scores autorisés, puis forme pour chaque position une somme pondérée des valeurs.

Voir les liens associés
RoPE

Méthode qui encode la position en faisant tourner les requêtes et les clés.

Rotary Position Embedding applique des rotations dépendantes de la position par paires de dimensions, faisant apparaître la distance relative dans les produits scalaires.

Voir les liens associés
RSources de la leçon3 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R11Source primaireVérifiée le 2026-07-18

    Su, J. et al.. RoFormer: Enhanced Transformer with Rotary Position Embedding (2021).

    Source de RoPE, méthode qui encode la position relative par rotations appliquées aux requêtes et aux clés.

    Consulter la source dans un nouvel onglet
  3. R12Source primaireVérifiée le 2026-07-18

    Press, O., Smith, N. A. et Lewis, M.. Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation (2021, version révisée 2022).

    Source d’ALiBi, qui introduit un biais linéaire dépendant de la distance dans les scores d’attention.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.