01
R1Attention Is All You Need
Vaswani, A. et al. · 2017
Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.
Bibliothèque de preuves
Chaque référence est reliée aux modules qu’elle éclaire. Son type, sa portée et sa date de vérification restent visibles pour éviter qu’une citation décorative ne passe pour une preuve.
Index consultable
Filtrez par nature, niveau de preuve ou module associé. Chaque fiche conserve son identifiant de référence.
29 sources sur 29
01
R1Vaswani, A. et al. · 2017
Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.
02
R2Radford, A. et al. · 2018
Source historique sur le préentraînement génératif d’un Transformer de type décodeur puis son adaptation aux tâches.
03
R3Radford, A. et al. · 2019
Rapport GPT-2 utile pour la prédiction autorégressive et l’apparition de capacités sans entraînement spécifique par tâche.
04
R4Brown, T. B. et al. · 2020
Référence GPT-3 pour l’apprentissage en contexte, le few-shot et les effets observés lors du changement d’échelle.
05
R5OpenAI · 2023, version mise à jour 2024
Source officielle qui confirme l’objectif de prochain token tout en déclarant non publiés les détails précis d’architecture et d’entraînement.
06
R6Ouyang, L. et al. · 2022
Référence InstructGPT pour distinguer préentraînement, démonstrations supervisées, modèle de récompense et optimisation par feedback humain.
07
R7DeepSeek-AI et al. · 2024, version révisée 2025
Source primaire des nombres publics de DeepSeek-V3 : 61 couches, dimension 7 168, 128 têtes MLA, 671B paramètres totaux et 37B actifs.
08
R8Hoffmann, J. et al. · 2022
Étude Chinchilla montrant que l’efficacité dépend d’un équilibre entre paramètres, quantité de données et budget de calcul.
09
R9Kaplan, J. et al. · 2020
Étude empirique des relations entre perte, taille du modèle, quantité de données et calcul d’entraînement.
10
R10Zhang, B. et Sennrich, R. · 2019
Source de RMSNorm, utile pour comparer les objectifs et calculs des variantes de normalisation dans les réseaux profonds.
11
R11Su, J. et al. · 2021
Source de RoPE, méthode qui encode la position relative par rotations appliquées aux requêtes et aux clés.
12
R12Press, O., Smith, N. A. et Lewis, M. · 2021, version révisée 2022
Source d’ALiBi, qui introduit un biais linéaire dépendant de la distance dans les scores d’attention.
13
R13Ainslie, J. et al. · 2023
Référence pour le partage groupé des clés et valeurs, destiné à réduire le cache et accélérer l’inférence.
14
R14Hugging Face · consulté en 2026
Documentation technique expliquant ce qui est mémorisé et réutilisé pendant une génération autorégressive avec cache KV.
15
R15Shazeer, N. et al. · 2017
Référence fondatrice du calcul conditionnel et des couches Mixture-of-Experts à activation éparse.
16
R16Fedus, W., Zoph, B. et Shazeer, N. · 2021, version révisée et JMLR 2022
Étude de Transformers épars à grande échelle, utile pour analyser routage, capacité et coût par token.
17
R17Huang, L. et al. · 2023, version révisée 2024
Synthèse structurée des types, causes, méthodes de détection et stratégies de réduction des hallucinations.
18
R18Elhage, N. et al. · 2022
Travail sur modèles jouets montrant comment plusieurs caractéristiques peuvent partager des dimensions, sans généralisation automatique à tous les LLM de production.
19
R19Bricken, T. et al. · 2023
Preuve de concept sur un Transformer d’une couche avec MLP de 512 neurones, utile pour dépasser l’idée naïve d’un neurone égal à un concept sans promettre l’interprétabilité complète des grands modèles.
20
R20OpenAI · consulté en 2026
Documentation officielle rappelant qu’un token peut être un fragment et que les approximations de comptage dépendent du modèle et de la langue.
21
R21OpenAI · consulté en 2026
Documentation officielle sur l’utilisation éventuelle des données pour améliorer les modèles selon l’offre, les réglages et le consentement ; elle ne décrit pas la fenêtre de contexte.
22
R22OpenAI · consulté en 2026
Documentation officielle sur les contrôles disponibles pour gérer l’utilisation des conversations et les choix de confidentialité.
23
R23OpenAI · consulté en 2026
Documentation produit actuelle sur la synthèse de mémoire alimentée par conversations, fichiers et applications, et sur l’ancien mécanisme de souvenirs enregistrés ; elle ne décrit pas la fenêtre de contexte.
24
R24OpenAI · consulté en 2026
Documentation officielle : absence d’historique et de mémoire de personnalisation, avec rétention possible jusqu’à 30 jours, instructions personnalisées, exception de sûreté et actions tierces à considérer.
25
R25Rafailov, R. et al. · 2023
Source de DPO, méthode qui optimise directement les préférences à partir de paires sans boucle complète d’apprentissage par renforcement.
26
R26Bai, Y. et al. · 2022
Étude d’un entraînement guidé par des principes et du feedback généré par modèle pour réduire des comportements nuisibles.
27
R27Bengio, Y. et al. · 2003
Jalon historique des modèles de langue neuronaux et de l’apprentissage de représentations distribuées des mots.
28
R28Sutskever, I., Vinyals, O. et Le, Q. V. · 2014
Référence historique sur les architectures récurrentes encodeur-décodeur pour transformer une séquence en une autre.
29
R29Bahdanau, D., Cho, K. et Bengio, Y. · 2014
Jalon de l’attention appliquée à la traduction neuronale avant l’auto-attention du Transformer.