AI ProdigiesCours interactifs
Ouvrir la navigation
Module 11 · Leçon 232 min · avance

GPT-4 et DeepSeek-V3 : deux niveaux de publication

Comparer un rapport qui retient ses détails architecturaux et un rapport qui publie une table précise d’hyperparamètres.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Formuler correctement une limite de publication sur GPT-4
  • Lire les nombres DeepSeek-V3 avec leurs étiquettes

Prérequis

  • Leçon 11.1

GPT-4 et DeepSeek-V3 : deux niveaux de publication

Situation concrète

La même question — combien de couches ? — reçoit deux réponses méthodologiques différentes selon ce que le laboratoire a choisi de publier.

Objectifs d’apprentissage

  • Formuler correctement une limite de publication sur GPT-4
  • Lire les nombres DeepSeek-V3 avec leurs étiquettes

Prérequis

  • Leçon 11.1

Mode simple

Le rapport technique GPT-4 décrit l’entraînement général, des évaluations et des limites, mais indique qu’il ne publie pas les détails d’architecture, de taille, de calcul et de données. On ne peut donc pas confirmer publiquement « GPT-4 a 61 couches » avec ce rapport. Le rapport DeepSeek-V3 publie une table : 61 couches, dimension cachée 7 168, 128 têtes MLA, 671 milliards de paramètres totaux et 37 milliards actifs par token. Ces nombres sont confirmés pour ce modèle et cette version.

Mode approfondi

L’absence de divulgation est une limite épistémique, non une preuve que toute estimation externe est fausse ; elle interdit seulement de la présenter comme fait officiel confirmé. À l’inverse, une table publique n’élimine pas l’obligation de lire définitions et notes. Le nombre de couches peut inclure des conventions propres, les paramètres actifs dépendent du routage et 128 qualifie les têtes documentées. La comparaison entre modèles exige une définition commune avant tout classement.

Analogie

Deux bâtiments peuvent sembler comparables, mais l’un fournit des plans détaillés et l’autre seulement un rapport de performance : on ne peut mesurer les mêmes pièces avec la même certitude.

Exemple concret

La phrase correcte est « DeepSeek-V3 publie une dimension cachée de 7 168 ». Retirer le nom du modèle transforme un fait précis en nombre flottant et trompeur.

Publié, non publié, attribué — Deux fiches placent côte à côte ce que les rapports GPT-4 et DeepSeek-V3 permettent ou non d’affirmer.

La fiche GPT-4 marque l’architecture détaillée non publiée ; la fiche DeepSeek-V3 liste cinq hyperparamètres avec leurs étiquettes.

Activité manipulable

Manipulez l’activité « claim-verification-lab », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

« Non public » n’autorise pas à recopier une estimation virale, et « public » n’autorise pas à transférer le nombre à une autre architecture.

Vérification rapide

Quel verdict donner à « GPT-4 a 61 couches » comme fait officiel ?

Non public dans le rapport technique GPT-4 ; l’affirmation est fausse si elle est présentée comme un fait officiel établi par cette source.

Résumé

  • GPT-4 ne divulgue pas son architecture détaillée.
  • DeepSeek-V3 publie plusieurs hyperparamètres précis.
  • Chaque nombre doit rester attaché à son modèle et à sa définition.

Mots du glossaire

Sources

Vue comparison

Publié, non publié, attribué

Deux fiches placent côte à côte ce que les rapports GPT-4 et DeepSeek-V3 permettent ou non d’affirmer.

Notions associées

  1. architecture propriétaire
  2. hyperparamètre
  3. attribution

Description de la figure

La fiche GPT-4 marque l’architecture détaillée non publiée ; la fiche DeepSeek-V3 liste cinq hyperparamètres avec leurs étiquettes.

Manipuler pour comprendre

Activité interactive

Activité interactive

Laboratoire de vérification des affirmations

Attribue un verdict à chaque affirmation, puis confronte-le à la correction et à la source primaire.

Six affirmations techniques sur les Transformers, GPT-4 et DeepSeek-V3 sont évaluées avec des verdicts nuancés et des sources publiques.

Affirmation 1

Le Transformer de 2017 remplace la récurrence par une architecture fondée sur l’attention.

Affirmation 2

GPT-4 contient exactement 1,76 billion de paramètres.

Affirmation 3

DeepSeek-V3 annonce 671 milliards de paramètres totaux et 37 milliards activés par token.

Affirmation 4

La configuration publiée de DeepSeek-V3 indique 61 couches Transformer.

Affirmation 5

La dimension cachée publiée pour DeepSeek-V3 est de 7 168.

Affirmation 6

Le mécanisme MLA de DeepSeek-V3 est configuré avec 128 têtes d’attention.

Affirmation 7

Une tête d’attention correspond toujours à une règle grammaticale facile à nommer.

Affirmation 8

L’attention compare chaque token à chaque autre token, donc tout Transformer a toujours exactement le même coût quadratique.

Affirmation 9

Dire que les embeddings placent les mots proches les uns des autres est une description complète de leur fonctionnement.

Vérification rapide

Le rapport technique GPT-4 publie le nombre exact de couches du modèle.

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Dimension cachée

Nombre de coordonnées utilisées dans la représentation interne d’un token.

La dimension cachée fixe la largeur principale des états du Transformer ; elle ne doit pas être confondue avec le nombre de couches, de têtes ou de paramètres.

Voir les liens associés
MLA

Variante d’attention multi-têtes qui compresse des informations de clés et valeurs dans un espace latent.

Multi-head Latent Attention reconstruit les représentations nécessaires depuis des codes latents afin de réduire notamment le coût du cache, selon les choix documentés de l’architecture.

Voir les liens associés
MoE

Modèle ou couche avec plusieurs experts dont seulement quelques-uns sont activés pour un token.

Mixture-of-Experts augmente la capacité paramétrique tout en gardant un calcul conditionnel ; routage, équilibrage et communications ajoutent toutefois leurs propres coûts.

Voir les liens associés
Paramètre

Nombre appris et conservé qui règle les transformations du modèle.

Les paramètres incluent matrices, vecteurs de biais ou échelles ; ils changent pendant l’entraînement mais restent normalement fixes pendant une inférence ordinaire.

Voir les liens associés
RSources de la leçon2 références, avec portée et date de vérification
  1. R5Source primaireVérifiée le 2026-07-18

    OpenAI. GPT-4 Technical Report (2023, version mise à jour 2024).

    Source officielle qui confirme l’objectif de prochain token tout en déclarant non publiés les détails précis d’architecture et d’entraînement.

    Consulter la source dans un nouvel onglet
  2. R7Source primaireVérifiée le 2026-07-18

    DeepSeek-AI et al.. DeepSeek-V3 Technical Report (2024, version révisée 2025).

    Source primaire des nombres publics de DeepSeek-V3 : 61 couches, dimension 7 168, 128 têtes MLA, 671B paramètres totaux et 37B actifs.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.