Donner une position aux tokens
Situation concrète
« Le chien mord le facteur » et « le facteur mord le chien » contiennent presque les mêmes unités, mais leurs relations changent avec l’ordre.
Objectifs d’apprentissage
- Expliquer pourquoi l’attention seule a besoin d’information de position
- Comparer plusieurs familles d’encodage positionnel
Prérequis
- Leçon 3.1
Mode simple
Le modèle doit savoir où chaque token se trouve et comment les positions se rapportent. Le Transformer original ajoutait des motifs numériques de position aux embeddings. D’autres modèles apprennent des positions, font tourner les requêtes et clés avec RoPE, ou ajoutent un biais lié à la distance avec ALiBi. Ces solutions ne stockent pas toutes l’ordre de la même façon, mais elles donnent au calcul un moyen de distinguer une séquence réordonnée.
Mode approfondi
Sans signal positionnel, une auto-attention pure est équivariante aux permutations : réordonner les entrées réordonne les sorties sans révéler l’ordre original. Les encodages sinusoïdaux ajoutent un vecteur déterministe ; RoPE applique des rotations dépendantes de la position à Q et K, faisant intervenir les écarts dans leur produit ; ALiBi ajoute un biais monotone aux scores. Les comportements hors longueur d’entraînement et les détails de mise à l’échelle dépendent de l’implémentation.
Analogie
Les mots sont des acteurs ; la position est le marquage au sol qui indique qui se tient avant, après ou loin d’un autre acteur.
Exemple concret
En déplaçant « seulement » dans une phrase, on change ce qui est limité. L’activité fait varier l’ordre sans changer le stock de mots pour isoler cet effet.
Trois colonnes montrent respectivement une addition à l’entrée, une rotation des requêtes et clés, et un malus sur les scores selon la distance.
Activité manipulable
Confusion fréquente
RoPE n’est pas une simple colonne ajoutée à l’embedding, et ALiBi ne fait pas tourner les vecteurs. Les regrouper sous « position » ne les rend pas interchangeables.
Vérification rapide
Que perdrait un mécanisme sans aucune information de position ?
Il ne pourrait pas distinguer correctement des séquences qui contiennent les mêmes représentations mais dans un ordre différent.
Résumé
- L’ordre doit être rendu accessible au calcul.
- Plusieurs méthodes injectent la position à des endroits différents.
- La distance et la longueur maximale exigent des nuances d’implémentation.
