AI ProdigiesCours interactifs
Ouvrir la navigation
Module 7 · Leçon 128 min · intermediaire

Préentraînement et fonction de perte

Suivre une boucle d’apprentissage où le modèle prédit, mesure son erreur et accumule des régularités à grande échelle.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Décrire l’objectif du préentraînement autorégressif
  • Interpréter la perte sans la confondre avec une note d’utilité

Prérequis

  • Module 5

Préentraînement et fonction de perte

Situation concrète

Avant de répondre à un utilisateur, le modèle a parcouru de nombreuses séquences et tenté de prédire leurs suites. Chaque erreur fournit un signal numérique, pas une explication en français.

Objectifs d’apprentissage

  • Décrire l’objectif du préentraînement autorégressif
  • Interpréter la perte sans la confondre avec une note d’utilité

Prérequis

  • Module 5

Mode simple

Pendant le préentraînement, le système cache le futur à chaque position et demande au modèle de donner une forte probabilité au token réellement observé. La perte augmente lorsque la cible reçoit une faible probabilité et diminue lorsqu’elle est bien prédite. De nombreux exemples sont regroupés en batch. Après plusieurs mises à jour, les paramètres capturent des régularités de langue, de structure et de contenu. Une petite perte ne garantit toutefois ni vérité, ni sécurité, ni utilité pour chaque tâche.

Mode approfondi

La perte d’entropie croisée moyenne correspond à la log-vraisemblance négative des tokens cibles, avec masquage éventuel de certaines positions. Le calcul s’effectue sur des batches distribués et des séquences préparées selon un pipeline de données. L’objectif fournit un gradient dense à de nombreuses positions, mais les choix de corpus, déduplication, qualité et pondération modèlent les capacités apprises. Les détails précis des données ne sont pas toujours publics.

Analogie

Un élève complète des milliers de phrases, reçoit un thermomètre d’erreur après chaque série et ajuste progressivement sa méthode.

Exemple concret

Si la cible est « Paris » et que le modèle lui donne 0,8, la contribution à la perte est plus faible que s’il lui donne 0,01, toutes choses égales par ailleurs.

Prédire, mesurer, préparer la correction — Un cycle relie batch de tokens, prédictions, cibles, perte agrégée et signal transmis à l’optimisation.

Cinq blocs en cercle montrent des séquences masquées, des distributions, la comparaison aux cibles, une jauge de perte et une flèche de correction.

Activité manipulable

Manipulez l’activité « training-simulation », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

La perte d’entraînement n’est pas un pourcentage de réponses vraies et ne compare pas directement toutes les qualités attendues d’un assistant.

Vérification rapide

Pourquoi une cible peu probable augmente-t-elle la perte ?

L’entropie croisée pénalise le logarithme négatif de la probabilité attribuée au token observé ; une très faible probabilité produit une grande pénalité.

Résumé

  • Le préentraînement apprend à prédire des tokens observés.
  • La perte résume l’erreur probabiliste du batch.
  • Le corpus et l’objectif ne couvrent pas toutes les qualités humaines.

Mots du glossaire

Sources

Vue flow

Prédire, mesurer, préparer la correction

Un cycle relie batch de tokens, prédictions, cibles, perte agrégée et signal transmis à l’optimisation.

Notions associées

  1. préentraînement
  2. perte
  3. batch

Description de la figure

Cinq blocs en cercle montrent des séquences masquées, des distributions, la comparaison aux cibles, une jauge de perte et une flèche de correction.

Manipuler pour comprendre

Activité interactive

Activité interactive

Optimisation scalaire simplifiée

Simulation de l’entraînement

Lance plusieurs ajustements et observe la prédiction, l’erreur et la perte.

Une courbe trace une perte quadratique illustrative à mesure qu’une prédiction scalaire se rapproche d’une cible.

Prédiction
0.200
Cible
0.900
Erreur
0.700
Perte
0.4900
Évolution de la perte
Courbe de perte par étapeLa perte part de 0.49 et vaut actuellement 0.4900 après 0 ajustements.Étapes d’ajustementPerte
Que devient la perte lorsque la prédiction se rapproche de la cible ?

Vérification rapide

Que mesure principalement la perte autorégressive de préentraînement ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Batch

Groupe d’exemples traité ensemble pendant une étape d’entraînement.

Un batch permet de paralléliser les calculs et d’estimer un gradient moyen ; sa taille influence mémoire, bruit d’optimisation et débit d’entraînement.

Voir les liens associés
Checkpoint

Copie sauvegardée des poids et états utiles à un moment de l’entraînement.

Un checkpoint peut contenir paramètres, état de l’optimiseur et compteurs d’étapes afin de reprendre, évaluer ou dériver un modèle depuis un point précis.

Voir les liens associés
Perte

Mesure numérique de l’écart entre la prédiction et la cible d’entraînement.

Pour un modèle de langue, la perte est souvent une entropie croisée négative sur le prochain token ; elle guide l’optimisation sans mesurer seule l’utilité globale.

Voir les liens associés
Préentraînement

Grande phase d’apprentissage général sur de nombreuses séquences.

Le préentraînement optimise à grande échelle un objectif tel que la prédiction du prochain token, produisant des représentations et capacités réutilisables.

Voir les liens associés
RSources de la leçon3 références, avec portée et date de vérification
  1. R2Source primaireVérifiée le 2026-07-18

    Radford, A. et al.. Improving Language Understanding by Generative Pre-Training (2018).

    Source historique sur le préentraînement génératif d’un Transformer de type décodeur puis son adaptation aux tâches.

    Consulter la source dans un nouvel onglet
  2. R3Source primaireVérifiée le 2026-07-18

    Radford, A. et al.. Language Models are Unsupervised Multitask Learners (2019).

    Rapport GPT-2 utile pour la prédiction autorégressive et l’apparition de capacités sans entraînement spécifique par tâche.

    Consulter la source dans un nouvel onglet
  3. R4Source primaireVérifiée le 2026-07-18

    Brown, T. B. et al.. Language Models are Few-Shot Learners (2020).

    Référence GPT-3 pour l’apprentissage en contexte, le few-shot et les effets observés lors du changement d’échelle.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.