Du modèle neuronal au Transformer
Situation concrète
Le Transformer n’est pas apparu seul. Il s’inscrit dans une suite de tentatives pour représenter les mots, traiter l’ordre et transmettre l’information sur de longues distances.
Objectifs d’apprentissage
- Situer cinq jalons de la modélisation neuronale du langage
- Expliquer quel problème chaque étape a cherché à résoudre
Prérequis
- Modules 1 à 4
Mode simple
Les modèles de langue probabilistes prédisaient déjà une suite. Les réseaux neuronaux ont appris des vecteurs distribués au lieu de traiter chaque mot comme une case isolée. Les réseaux récurrents parcouraient la séquence étape par étape, ce qui rendait les dépendances lointaines et la parallélisation difficiles. L’attention en traduction a permis de consulter directement plusieurs états d’entrée. Le Transformer a ensuite construit l’architecture autour de l’attention, sans récurrence dans le chemin principal étudié. GPT a adapté des blocs de type décodeur à la prédiction autorégressive.
Mode approfondi
Bengio et al. apprennent conjointement représentations et probabilités conditionnelles ; les architectures seq2seq compressent puis déroulent des séquences avec des réseaux récurrents ; Bahdanau et al. introduisent un alignement appris entre décodeur et états encodeurs. Vaswani et al. remplacent récurrence et convolution par attention multi-têtes, position et blocs feed-forward pour la transduction. Les premiers GPT montrent ensuite qu’un préentraînement génératif de décodeur peut être transféré ou utilisé sur de multiples tâches.
Analogie
L’histoire ressemble à une série de ponts : chaque génération conserve des idées utiles et construit une travée pour franchir une limite précédente.
Exemple concret
Un RNN doit transporter une information au fil des pas ; l’attention crée un chemin de consultation direct vers plusieurs positions, même si son coût dépend de la longueur.
Une ligne datée de 2003 à 2018 présente cinq jalons, chacun avec le problème visé et l’idée ajoutée.
Activité manipulable
Confusion fréquente
Une frise ne signifie pas que chaque architecture remplace entièrement les précédentes. Des réseaux récurrents et d’autres familles restent utiles dans certains contextes.
Vérification rapide
Quel changement majeur apporte le Transformer de 2017 ?
Il organise la transduction autour de l’attention multi-têtes et de blocs feed-forward, sans récurrence ni convolution dans l’architecture principale décrite.
Résumé
- La prédiction du langage précède les LLM modernes.
- Vecteurs et attention ont résolu des limites différentes.
- GPT combine décodeur autorégressif et préentraînement à grande échelle.
