Préentraînement et fonction de perte
Situation concrète
Avant de répondre à un utilisateur, le modèle a parcouru de nombreuses séquences et tenté de prédire leurs suites. Chaque erreur fournit un signal numérique, pas une explication en français.
Objectifs d’apprentissage
- Décrire l’objectif du préentraînement autorégressif
- Interpréter la perte sans la confondre avec une note d’utilité
Prérequis
- Module 5
Mode simple
Pendant le préentraînement, le système cache le futur à chaque position et demande au modèle de donner une forte probabilité au token réellement observé. La perte augmente lorsque la cible reçoit une faible probabilité et diminue lorsqu’elle est bien prédite. De nombreux exemples sont regroupés en batch. Après plusieurs mises à jour, les paramètres capturent des régularités de langue, de structure et de contenu. Une petite perte ne garantit toutefois ni vérité, ni sécurité, ni utilité pour chaque tâche.
Mode approfondi
La perte d’entropie croisée moyenne correspond à la log-vraisemblance négative des tokens cibles, avec masquage éventuel de certaines positions. Le calcul s’effectue sur des batches distribués et des séquences préparées selon un pipeline de données. L’objectif fournit un gradient dense à de nombreuses positions, mais les choix de corpus, déduplication, qualité et pondération modèlent les capacités apprises. Les détails précis des données ne sont pas toujours publics.
Analogie
Un élève complète des milliers de phrases, reçoit un thermomètre d’erreur après chaque série et ajuste progressivement sa méthode.
Exemple concret
Si la cible est « Paris » et que le modèle lui donne 0,8, la contribution à la perte est plus faible que s’il lui donne 0,01, toutes choses égales par ailleurs.
Cinq blocs en cercle montrent des séquences masquées, des distributions, la comparaison aux cibles, une jauge de perte et une flèche de correction.
Activité manipulable
Confusion fréquente
La perte d’entraînement n’est pas un pourcentage de réponses vraies et ne compare pas directement toutes les qualités attendues d’un assistant.
Vérification rapide
Pourquoi une cible peu probable augmente-t-elle la perte ?
L’entropie croisée pénalise le logarithme négatif de la probabilité attribuée au token observé ; une très faible probabilité produit une grande pénalité.
Résumé
- Le préentraînement apprend à prédire des tokens observés.
- La perte résume l’erreur probabiliste du batch.
- Le corpus et l’objectif ne couvrent pas toutes les qualités humaines.
