AI ProdigiesCours interactifs
Ouvrir la navigation
Module 11 · Leçon 340 min · avance

Huit cas pour éprouver la méthode

Classer huit affirmations fréquentes sur couches, tokens, mémoire, échelle, attention, RLHF et citations.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Attribuer un verdict justifié aux huit études de cas
  • Expliquer la confusion précise qui rend chaque formule dangereuse

Prérequis

  • Leçon 11.2

Huit cas pour éprouver la méthode

Situation concrète

Une méthode se juge sur des phrases concrètes. Les huit cas couvrent des erreurs d’attribution, de définition, de mémoire, de causalité et de preuve.

Objectifs d’apprentissage

  • Attribuer un verdict justifié aux huit études de cas
  • Expliquer la confusion précise qui rend chaque formule dangereuse

Prérequis

  • Leçon 11.2

Mode simple

Le laboratoire examine : « GPT-4 a 61 couches » — non public ; « DeepSeek-V3 a une largeur de 7 168 » — confirmé pour ce modèle ; « un token est un mot » — trop simplifié ; « le modèle se souvient de tout » — faux comme règle générale ; « plus de paramètres signifie toujours meilleur » — simplification excessive ; « l’attention est la conscience » — trompeur ; « le RLHF rend vrai » — faux comme garantie ; « une citation suffit » — méthode insuffisante. Pour chaque cas, identifiez d’abord la catégorie d’erreur avant de lire la correction.

Mode approfondi

Les cas mobilisent des relations de preuve différentes : silence d’une source, confirmation tabulaire, contre-exemple définitionnel, confusion de couches système, généralisation abusive d’une tendance empirique, anthropomorphisme, confusion d’objectif d’optimisation et défaut de provenance. Cette diversité empêche d’appliquer mécaniquement un unique test. Un verdict robuste nomme la proposition, la source décisive, le mécanisme de l’erreur et une reformulation acceptable.

Analogie

Un contrôle technique n’utilise pas la même mesure pour les freins, les pneus et les émissions, mais consigne chaque résultat dans une grille cohérente.

Exemple concret

Pour « une citation suffit », la correction n’est pas « aucune citation ne vaut rien » : il faut ouvrir la référence, retrouver le passage et vérifier qu’il soutient la conclusion.

Huit affirmations, huit mécanismes d’erreur — Une matrice croise cas, verdict, source déterminante, confusion et reformulation prudente.

Huit lignes de cas sont réparties entre non public, confirmé, simplifié, faux, trompeur et insuffisant, avec une source par ligne.

Activité manipulable

Manipulez l’activité « claim-verification-lab », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

Mémoriser seulement les verdicts rate l’objectif. Il faut pouvoir reconstruire la méthode et réagir à une nouvelle affirmation.

Vérification rapide

Quel point commun relie les huit corrections ?

Elles limitent la portée de la phrase à ce que les définitions et sources permettent réellement d’affirmer, sans importer une certitude extérieure.

Résumé

  • Chaque erreur possède un mécanisme identifiable.
  • Le verdict s’accompagne d’une reformulation.
  • La méthode doit se transférer à de nouveaux cas.

Mots du glossaire

Sources

Vue matrix

Huit affirmations, huit mécanismes d’erreur

Une matrice croise cas, verdict, source déterminante, confusion et reformulation prudente.

Notions associées

  1. étude de cas
  2. verdict
  3. anti-confusion

Description de la figure

Huit lignes de cas sont réparties entre non public, confirmé, simplifié, faux, trompeur et insuffisant, avec une source par ligne.

Manipuler pour comprendre

Activité interactive

Activité interactive

Laboratoire de vérification des affirmations

Attribue un verdict à chaque affirmation, puis confronte-le à la correction et à la source primaire.

Six affirmations techniques sur les Transformers, GPT-4 et DeepSeek-V3 sont évaluées avec des verdicts nuancés et des sources publiques.

Affirmation 1

Le Transformer de 2017 remplace la récurrence par une architecture fondée sur l’attention.

Affirmation 2

GPT-4 contient exactement 1,76 billion de paramètres.

Affirmation 3

DeepSeek-V3 annonce 671 milliards de paramètres totaux et 37 milliards activés par token.

Affirmation 4

La configuration publiée de DeepSeek-V3 indique 61 couches Transformer.

Affirmation 5

La dimension cachée publiée pour DeepSeek-V3 est de 7 168.

Affirmation 6

Le mécanisme MLA de DeepSeek-V3 est configuré avec 128 têtes d’attention.

Affirmation 7

Une tête d’attention correspond toujours à une règle grammaticale facile à nommer.

Affirmation 8

L’attention compare chaque token à chaque autre token, donc tout Transformer a toujours exactement le même coût quadratique.

Affirmation 9

Dire que les embeddings placent les mots proches les uns des autres est une description complète de leur fonctionnement.

Vérification rapide

Quelles affirmations du laboratoire sont des simplifications excessives ou trompeuses ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Attention

Calcul qui mesure quels tokens sont utiles pour mettre à jour la représentation d’un autre token.

L’attention compare requêtes et clés, applique une normalisation aux scores autorisés, puis forme pour chaque position une somme pondérée des valeurs.

Voir les liens associés
Contexte

Informations disponibles pour calculer la réponse actuelle.

Le contexte correspond aux tokens effectivement fournis dans la fenêtre courante, y compris instructions et documents récupérés, et reste distinct des paramètres et d’une mémoire produit persistante.

Voir les liens associés
Paramètre

Nombre appris et conservé qui règle les transformations du modèle.

Les paramètres incluent matrices, vecteurs de biais ou échelles ; ils changent pendant l’entraînement mais restent normalement fixes pendant une inférence ordinaire.

Voir les liens associés
RLHF

Méthodes qui utilisent des préférences humaines pour orienter les réponses.

Le RLHF classique entraîne un modèle de récompense à partir de comparaisons puis optimise la politique ; il aligne des préférences mesurées sans garantir la vérité.

Voir les liens associés
Token

Unité de texte manipulée par le modèle, parfois mot, fragment, signe ou espace.

Le token est un identifiant dans un vocabulaire propre au tokenizer ; sa frontière dépend de l’encodage, de la langue et du modèle considéré.

Voir les liens associés
RSources de la leçon8 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R5Source primaireVérifiée le 2026-07-18

    OpenAI. GPT-4 Technical Report (2023, version mise à jour 2024).

    Source officielle qui confirme l’objectif de prochain token tout en déclarant non publiés les détails précis d’architecture et d’entraînement.

    Consulter la source dans un nouvel onglet
  3. R6Source primaireVérifiée le 2026-07-18

    Ouyang, L. et al.. Training language models to follow instructions with human feedback (2022).

    Référence InstructGPT pour distinguer préentraînement, démonstrations supervisées, modèle de récompense et optimisation par feedback humain.

    Consulter la source dans un nouvel onglet
  4. R7Source primaireVérifiée le 2026-07-18

    DeepSeek-AI et al.. DeepSeek-V3 Technical Report (2024, version révisée 2025).

    Source primaire des nombres publics de DeepSeek-V3 : 61 couches, dimension 7 168, 128 têtes MLA, 671B paramètres totaux et 37B actifs.

    Consulter la source dans un nouvel onglet
  5. R8Source primaireVérifiée le 2026-07-18

    Hoffmann, J. et al.. Training Compute-Optimal Large Language Models (2022).

    Étude Chinchilla montrant que l’efficacité dépend d’un équilibre entre paramètres, quantité de données et budget de calcul.

    Consulter la source dans un nouvel onglet
  6. R9Source primaireVérifiée le 2026-07-18

    Kaplan, J. et al.. Scaling Laws for Neural Language Models (2020).

    Étude empirique des relations entre perte, taille du modèle, quantité de données et calcul d’entraînement.

    Consulter la source dans un nouvel onglet
  7. R20Fait public confirméVérifiée le 2026-07-18

    OpenAI. What are tokens and how to count them? (consulté en 2026).

    Documentation officielle rappelant qu’un token peut être un fragment et que les approximations de comptage dépendent du modèle et de la langue.

    Consulter la source dans un nouvel onglet
  8. R23Fait public confirméVérifiée le 2026-07-18

    OpenAI. Memory FAQ (consulté en 2026).

    Documentation produit actuelle sur la synthèse de mémoire alimentée par conversations, fichiers et applications, et sur l’ancien mécanisme de souvenirs enregistrés ; elle ne décrit pas la fenêtre de contexte.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.