Transformer, GPT et produit conversationnel
Situation concrète
Trois noms apparaissent souvent dans la même phrase alors qu’ils désignent des niveaux différents : une architecture, une lignée de modèles et un service utilisable.
Objectifs d’apprentissage
- Distinguer Transformer, GPT et application conversationnelle
- Identifier ce qui relève du modèle ou du système autour de lui
Prérequis
- Modules 4 et 5
Mode simple
Le Transformer de 2017 décrit une architecture encodeur-décodeur fondée sur l’attention. GPT désigne une famille qui utilise des blocs de type décodeur pour la modélisation autorégressive. Un produit conversationnel ajoute au modèle une interface, des instructions système, des règles de sécurité, une gestion du contexte et parfois des outils ou une mémoire. Dire que le produit est « seulement le décodeur » oublie ces couches de système, même si le cœur du modèle suit une architecture décodeur.
Mode approfondi
Le terme decoder-only décrit le sens du masque et l’objectif autorégressif, non l’absence de toute infrastructure d’encodage du texte ou de post-traitement. Les rapports GPT publics documentent certains objectifs et résultats, mais les détails divulgués varient selon les générations. Le comportement observable résulte de la base préentraînée, du post-entraînement, du format de conversation, du décodage et des composants orchestrés autour d’elle.
Analogie
Un moteur, un modèle de voiture et un service de transport sont reliés, mais ils ne décrivent pas le même objet ni les mêmes responsabilités.
Exemple concret
Une recherche documentaire peut fournir des passages au modèle avant sa réponse. Cette capacité vient du système de récupération et du contexte ajouté, pas d’un changement instantané de l’architecture des poids.
Une petite carte architecture est contenue dans une carte modèle, elle-même dans une carte produit plus large avec plusieurs services.
Activité manipulable
Confusion fréquente
Attribuer une fonctionnalité de l’interface directement aux poids du modèle masque les conditions réelles de disponibilité, de confidentialité et de vérification.
Vérification rapide
Une mémoire enregistrée entre conversations fait-elle partie de la définition du Transformer ?
Non. C’est une fonctionnalité de produit ou de système qui peut réinjecter des informations ; le Transformer ne l’impose pas par sa définition.
Résumé
- Transformer est une famille d’architecture.
- GPT décrit une lignée autorégressive de type décodeur.
- Le produit ajoute des composants et des règles autour du modèle.
