AI ProdigiesCours interactifs
Ouvrir la navigation
Module 5 · Leçon 228 min · avance

Pourquoi le contexte long coûte cher

Relier la longueur d’une séquence au nombre de comparaisons de l’attention dense et distinguer entraînement, préremplissage et génération.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Calculer l’ordre de grandeur d’une matrice d’attention
  • Nuancer l’expression coût quadratique selon la phase

Prérequis

  • Leçon 5.1

Pourquoi le contexte long coûte cher

Situation concrète

Doubler la longueur d’un texte ne double pas toujours le travail de l’attention dense : lorsque chaque position compare toutes les autres, les paires se multiplient beaucoup plus vite.

Objectifs d’apprentissage

  • Calculer l’ordre de grandeur d’une matrice d’attention
  • Nuancer l’expression coût quadratique selon la phase

Prérequis

  • Leçon 5.1

Mode simple

Pour n tokens, une matrice d’attention dense contient environ n × n cases avant de tenir compte du masque. Passer de 1 000 à 2 000 positions multiplie donc le nombre de paires par quatre. La mémoire des poids d’attention et le calcul augmentent. Cependant, le coût exact dépend du matériel, des noyaux optimisés, du nombre de couches, du batch et de la phase. Pendant la génération avec cache, le nouveau token compare surtout les clés déjà conservées au lieu de recalculer toute la matrice carrée.

Mode approfondi

L’auto-attention dense a une composante temporelle O(n²d) pour QKᵀ et AV et une empreinte naïve O(n²) pour les poids, même si des noyaux fusionnés réduisent les écritures mémoire. Le préremplissage d’un prompt long diffère du décodage incrémental : à l’étape t avec cache, la nouvelle requête effectue environ O(td) de comparaison, tandis que le cache croît en O(t) par couche et tête key-value. Les variantes clairsemées ou linéaires changent encore cette analyse.

Analogie

Dans une salle, si chaque personne doit comparer sa note avec celle de toutes les autres, ajouter des participants crée bien plus que quelques nouvelles rencontres.

Exemple concret

Une matrice 512 × 512 contient 262 144 cellules ; une matrice 1 024 × 1 024 en contient 1 048 576, soit quatre fois plus.

La courbe n au carré — Une courbe et une matrice évolutive montrent le nombre de paires lorsque la longueur du contexte double.

La courbe monte de plus en plus vite et quatre matrices indiquent que doubler le côté quadruple le nombre de cellules.

Activité manipulable

Manipulez l’activité « attention-cost-graph », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

Dire « tout Transformer coûte toujours exactement n² » ignore décodage avec cache, attention clairsemée, kernels, batch et autres choix d’architecture.

Vérification rapide

Pourquoi doubler n quadruple-t-il une matrice n × n ?

Les deux dimensions doublent : (2n) × (2n) = 4n². Chaque axe représente une position comparée à une position.

Résumé

  • L’attention dense forme une matrice longueur par longueur.
  • Préremplissage et décodage n’ont pas le même profil.
  • Le coût réel dépend de l’implémentation et de l’architecture.

Mots du glossaire

Sources

Vue chart

La courbe n au carré

Une courbe et une matrice évolutive montrent le nombre de paires lorsque la longueur du contexte double.

Notions associées

  1. complexité quadratique
  2. fenêtre de contexte
  3. mémoire

Description de la figure

La courbe monte de plus en plus vite et quatre matrices indiquent que doubler le côté quadruple le nombre de cellules.

Manipuler pour comprendre

Activité interactive

Activité interactive

Attention standard : n²

Graphique du coût de l’attention

Faites varier la longueur, puis placez le curseur à 256 tokens pour mesurer l’effet d’un doublement.

Un graphique SVG accessible présente le nombre de comparaisons de l’attention standard selon la longueur du contexte.

De 16 à 512 tokens, par pas de 16.

128 tokens
Longueur
128 tokens
Comparaisons
16 384
Face à 128 tokens
× 1
Croissance quadratique du nombre de comparaisons d’attentionLa longueur du contexte en tokens est portée sur l’axe horizontal, de zéro à 512. Le nombre de comparaisons est porté sur l’axe vertical, de zéro à 262 144. La courbe suit la formule n au carré.065 536131 072196 608262 1440128256384512Attention standard n²Longueur du contexte (tokens)Comparaisons (unités)
Chaque token compare sa requête aux clés des n tokens : n × n donne n² comparaisons. Ce graphique isole ce coût pédagogique et ne mesure pas toute la durée d’exécution d’un modèle.

Vérification rapide

Combien de cellules contient une matrice d’attention dense lorsque la longueur passe de n à 2n ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
ALiBi

Méthode qui ajoute dans l’attention un malus lorsque deux tokens sont éloignés.

ALiBi ajoute aux scores d’attention un biais linéaire propre à chaque tête et proportionnel à la distance, sans créer d’embedding positionnel appris séparé.

Voir les liens associés
Attention

Calcul qui mesure quels tokens sont utiles pour mettre à jour la représentation d’un autre token.

L’attention compare requêtes et clés, applique une normalisation aux scores autorisés, puis forme pour chaque position une somme pondérée des valeurs.

Voir les liens associés
Fenêtre de contexte

Nombre maximal de tokens disponibles ensemble pour calculer une réponse.

La fenêtre inclut les différentes parties du prompt et les tokens générés ; dépasser la limite impose troncature, résumé ou sélection de contenu selon le système.

Voir les liens associés
RSources de la leçon2 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R12Source primaireVérifiée le 2026-07-18

    Press, O., Smith, N. A. et Lewis, M.. Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation (2021, version révisée 2022).

    Source d’ALiBi, qui introduit un biais linéaire dépendant de la distance dans les scores d’attention.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.