AI ProdigiesCours interactifs
Ouvrir la navigation
Module 10 · Leçon 130 min · intermediaire

Du modèle neuronal au Transformer

Parcourir les jalons qui relient prédiction du langage, représentations distribuées, réseaux séquentiels, attention et Transformer.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Situer cinq jalons de la modélisation neuronale du langage
  • Expliquer quel problème chaque étape a cherché à résoudre

Prérequis

  • Modules 1 à 4

Du modèle neuronal au Transformer

Situation concrète

Le Transformer n’est pas apparu seul. Il s’inscrit dans une suite de tentatives pour représenter les mots, traiter l’ordre et transmettre l’information sur de longues distances.

Objectifs d’apprentissage

  • Situer cinq jalons de la modélisation neuronale du langage
  • Expliquer quel problème chaque étape a cherché à résoudre

Prérequis

  • Modules 1 à 4

Mode simple

Les modèles de langue probabilistes prédisaient déjà une suite. Les réseaux neuronaux ont appris des vecteurs distribués au lieu de traiter chaque mot comme une case isolée. Les réseaux récurrents parcouraient la séquence étape par étape, ce qui rendait les dépendances lointaines et la parallélisation difficiles. L’attention en traduction a permis de consulter directement plusieurs états d’entrée. Le Transformer a ensuite construit l’architecture autour de l’attention, sans récurrence dans le chemin principal étudié. GPT a adapté des blocs de type décodeur à la prédiction autorégressive.

Mode approfondi

Bengio et al. apprennent conjointement représentations et probabilités conditionnelles ; les architectures seq2seq compressent puis déroulent des séquences avec des réseaux récurrents ; Bahdanau et al. introduisent un alignement appris entre décodeur et états encodeurs. Vaswani et al. remplacent récurrence et convolution par attention multi-têtes, position et blocs feed-forward pour la transduction. Les premiers GPT montrent ensuite qu’un préentraînement génératif de décodeur peut être transféré ou utilisé sur de multiples tâches.

Analogie

L’histoire ressemble à une série de ponts : chaque génération conserve des idées utiles et construit une travée pour franchir une limite précédente.

Exemple concret

Un RNN doit transporter une information au fil des pas ; l’attention crée un chemin de consultation direct vers plusieurs positions, même si son coût dépend de la longueur.

Cinq jalons de la généalogie — Une frise relie modèle neuronal de langue, seq2seq, attention d’alignement, Transformer et préentraînement GPT.

Une ligne datée de 2003 à 2018 présente cinq jalons, chacun avec le problème visé et l’idée ajoutée.

Activité manipulable

Manipulez l’activité « word-order-challenge », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

Une frise ne signifie pas que chaque architecture remplace entièrement les précédentes. Des réseaux récurrents et d’autres familles restent utiles dans certains contextes.

Vérification rapide

Quel changement majeur apporte le Transformer de 2017 ?

Il organise la transduction autour de l’attention multi-têtes et de blocs feed-forward, sans récurrence ni convolution dans l’architecture principale décrite.

Résumé

  • La prédiction du langage précède les LLM modernes.
  • Vecteurs et attention ont résolu des limites différentes.
  • GPT combine décodeur autorégressif et préentraînement à grande échelle.

Mots du glossaire

Sources

Vue timeline

Cinq jalons de la généalogie

Une frise relie modèle neuronal de langue, seq2seq, attention d’alignement, Transformer et préentraînement GPT.

Notions associées

  1. histoire
  2. représentation distribuée
  3. séquence
  4. attention

Description de la figure

Une ligne datée de 2003 à 2018 présente cinq jalons, chacun avec le problème visé et l’idée ajoutée.

Manipuler pour comprendre

Activité interactive

Activité interactive

Position des tokens

Défi sur l’ordre des mots

Remets les cinq mots dans l’ordre pour former « Le chien suit le chat ». Sélectionne un mot, puis déplace-le avec les boutons ou les flèches du clavier.

L’ordre actuel est : suit chat Le chien le. Chaque mot est un bouton déplaçable vers la gauche ou la droite. Une phrase de comparaison montre que les mêmes mots peuvent attribuer des rôles différents.

Phrase à reconstruire

Qui suit qui ?

0/5 bien placé

Sélectionne d’abord un mot.

Comparaison du sens

Le chien suit le chat.

Le chien est celui qui se déplace derrière le chat.

Le chat suit le chien.

Les mêmes mots nomment les mêmes êtres, mais leurs rôles sont inversés.

Un embedding de token seul n’indique pas sa place. Le Transformer lui ajoute une information de position afin que l’attention puisse tenir compte de l’ordre.

Vérification rapide

Quel jalon introduit un alignement appris entre décodeur et états d’entrée avant le Transformer ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Attention

Calcul qui mesure quels tokens sont utiles pour mettre à jour la représentation d’un autre token.

L’attention compare requêtes et clés, applique une normalisation aux scores autorisés, puis forme pour chaque position une somme pondérée des valeurs.

Voir les liens associés
Embedding

Vecteur initial associé à un token avant les transformations contextuelles.

La table d’embeddings projette un identifiant discret dans un espace continu ; après les couches, l’état dépend aussi des autres tokens et de leur position.

Voir les liens associés
LLM

Grand modèle de langage entraîné sur beaucoup de séquences textuelles.

Un Large Language Model estime des distributions sur des tokens avec un réseau à nombreux paramètres ; le terme ne fixe ni une architecture unique ni un seuil universel de taille.

Voir les liens associés
Transformer

Architecture qui traite les relations entre positions grâce à l’attention et à des blocs répétés.

Le Transformer original combine attention, réseaux feed-forward, positions, résidus et normalisation ; les LLM modernes en utilisent de nombreuses variantes.

Voir les liens associés
RSources de la leçon5 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R2Source primaireVérifiée le 2026-07-18

    Radford, A. et al.. Improving Language Understanding by Generative Pre-Training (2018).

    Source historique sur le préentraînement génératif d’un Transformer de type décodeur puis son adaptation aux tâches.

    Consulter la source dans un nouvel onglet
  3. R27Source primaireVérifiée le 2026-07-18

    Bengio, Y. et al.. A Neural Probabilistic Language Model (2003).

    Jalon historique des modèles de langue neuronaux et de l’apprentissage de représentations distribuées des mots.

    Consulter la source dans un nouvel onglet
  4. R28Source primaireVérifiée le 2026-07-18

    Sutskever, I., Vinyals, O. et Le, Q. V.. Sequence to Sequence Learning with Neural Networks (2014).

    Référence historique sur les architectures récurrentes encodeur-décodeur pour transformer une séquence en une autre.

    Consulter la source dans un nouvel onglet
  5. R29Source primaireVérifiée le 2026-07-18

    Bahdanau, D., Cho, K. et Bengio, Y.. Neural Machine Translation by Jointly Learning to Align and Translate (2014).

    Jalon de l’attention appliquée à la traduction neuronale avant l’auto-attention du Transformer.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.