AI ProdigiesCours interactifs
Ouvrir la navigation
Module 6 · Leçon 125 min · intermediaire

Transformer, GPT et produit conversationnel

Séparer une architecture générale, une famille de modèles autorégressifs et un produit complet avec interface, règles et outils.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Distinguer Transformer, GPT et application conversationnelle
  • Identifier ce qui relève du modèle ou du système autour de lui

Prérequis

  • Modules 4 et 5

Transformer, GPT et produit conversationnel

Situation concrète

Trois noms apparaissent souvent dans la même phrase alors qu’ils désignent des niveaux différents : une architecture, une lignée de modèles et un service utilisable.

Objectifs d’apprentissage

  • Distinguer Transformer, GPT et application conversationnelle
  • Identifier ce qui relève du modèle ou du système autour de lui

Prérequis

  • Modules 4 et 5

Mode simple

Le Transformer de 2017 décrit une architecture encodeur-décodeur fondée sur l’attention. GPT désigne une famille qui utilise des blocs de type décodeur pour la modélisation autorégressive. Un produit conversationnel ajoute au modèle une interface, des instructions système, des règles de sécurité, une gestion du contexte et parfois des outils ou une mémoire. Dire que le produit est « seulement le décodeur » oublie ces couches de système, même si le cœur du modèle suit une architecture décodeur.

Mode approfondi

Le terme decoder-only décrit le sens du masque et l’objectif autorégressif, non l’absence de toute infrastructure d’encodage du texte ou de post-traitement. Les rapports GPT publics documentent certains objectifs et résultats, mais les détails divulgués varient selon les générations. Le comportement observable résulte de la base préentraînée, du post-entraînement, du format de conversation, du décodage et des composants orchestrés autour d’elle.

Analogie

Un moteur, un modèle de voiture et un service de transport sont reliés, mais ils ne décrivent pas le même objet ni les mêmes responsabilités.

Exemple concret

Une recherche documentaire peut fournir des passages au modèle avant sa réponse. Cette capacité vient du système de récupération et du contexte ajouté, pas d’un changement instantané de l’architecture des poids.

Trois niveaux à ne pas confondre — Des cartes imbriquées séparent architecture Transformer, modèle GPT et produit avec interface, politiques, mémoire et outils.

Une petite carte architecture est contenue dans une carte modèle, elle-même dans une carte produit plus large avec plusieurs services.

Activité manipulable

Manipulez l’activité « attention-architecture-comparator », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

Attribuer une fonctionnalité de l’interface directement aux poids du modèle masque les conditions réelles de disponibilité, de confidentialité et de vérification.

Vérification rapide

Une mémoire enregistrée entre conversations fait-elle partie de la définition du Transformer ?

Non. C’est une fonctionnalité de produit ou de système qui peut réinjecter des informations ; le Transformer ne l’impose pas par sa définition.

Résumé

  • Transformer est une famille d’architecture.
  • GPT décrit une lignée autorégressive de type décodeur.
  • Le produit ajoute des composants et des règles autour du modèle.

Mots du glossaire

Sources

Vue cards

Trois niveaux à ne pas confondre

Des cartes imbriquées séparent architecture Transformer, modèle GPT et produit avec interface, politiques, mémoire et outils.

Notions associées

  1. architecture décodeur
  2. modèle
  3. produit

Description de la figure

Une petite carte architecture est contenue dans une carte modèle, elle-même dans une carte produit plus large avec plusieurs services.

Manipuler pour comprendre

Activité interactive

Activité interactive

Comparaison conceptuelle simplifiée

Comparateur MHA, MQA, GQA et MLA

Explore les quatre familles, puis retrouve l’architecture qui regroupe les têtes de requête autour de plusieurs ensembles K/V.

Un tableau compare requêtes, clés, valeurs, regroupement, mémoire relative et compromis des architectures d’attention.

Requêtes : Une par tête

Clés : Une par tête

Valeurs : Une par tête

Groupes : Chaque tête a son groupe K/V

Mémoire relative : Élevée

Compromis : Grande flexibilité, cache KV plus volumineux.

Résumé pédagogique : les performances réelles dépendent de l’implémentation, de l’entraînement et du matériel.
TypeOrganisation K/VMémoireCompromis
MHAChaque tête a son groupe K/VÉlevéeGrande flexibilité, cache KV plus volumineux.
MQAUn seul groupe K/VTrès faibleCache compact, partage K/V pouvant réduire la capacité selon le modèle.
GQAPlusieurs têtes Q partagent K/VIntermédiaireCompromis courant entre capacité et coût du cache.
MLAPartage par espace latent, pas un simple GQAFaible dans les implémentations publiéesRéduit le cache via compression latente, avec une architecture et des calculs plus complexes.
Quelle architecture partage K/V par groupes de têtes Q ?

Vérification rapide

Quel niveau décrit un produit conversationnel complet ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Autorégressif

Qui produit la suite une unité après l’autre en utilisant les unités déjà présentes.

Un modèle autorégressif factorise la probabilité d’une séquence en probabilités conditionnelles successives et applique un masque causal pendant l’apprentissage.

Voir les liens associés
LLM

Grand modèle de langage entraîné sur beaucoup de séquences textuelles.

Un Large Language Model estime des distributions sur des tokens avec un réseau à nombreux paramètres ; le terme ne fixe ni une architecture unique ni un seuil universel de taille.

Voir les liens associés
Transformer

Architecture qui traite les relations entre positions grâce à l’attention et à des blocs répétés.

Le Transformer original combine attention, réseaux feed-forward, positions, résidus et normalisation ; les LLM modernes en utilisent de nombreuses variantes.

Voir les liens associés
RSources de la leçon4 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R2Source primaireVérifiée le 2026-07-18

    Radford, A. et al.. Improving Language Understanding by Generative Pre-Training (2018).

    Source historique sur le préentraînement génératif d’un Transformer de type décodeur puis son adaptation aux tâches.

    Consulter la source dans un nouvel onglet
  3. R3Source primaireVérifiée le 2026-07-18

    Radford, A. et al.. Language Models are Unsupervised Multitask Learners (2019).

    Rapport GPT-2 utile pour la prédiction autorégressive et l’apparition de capacités sans entraînement spécifique par tâche.

    Consulter la source dans un nouvel onglet
  4. R5Source primaireVérifiée le 2026-07-18

    OpenAI. GPT-4 Technical Report (2023, version mise à jour 2024).

    Source officielle qui confirme l’objectif de prochain token tout en déclarant non publiés les détails précis d’architecture et d’entraînement.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.