AI ProdigiesCours interactifs
Ouvrir la navigation

Atlas des notions · fiche 04

Les mots techniques,
sans brouillard.

Chaque terme possède deux portes d’entrée : une définition intuitive qui reste juste, puis les nuances techniques utiles. Les liens vous ramènent aux leçons où la notion agit vraiment.

Entrées
59
Lectures
Simple puis approfondie
Révision
Cartes mémoire

Mode d’emploi

Cherchez un mot, suivez une lettre ou isolez un module. Chaque entrée reste reliée aux leçons où la notion prend sens.

Recherche · index alphabétique · cartes mémoire

Consultation

59 termes répertoriés

  1. 01

    A1 module

    Notion

    Activation

    Lecture simple

    Nombre temporaire calculé pendant une réponse, comme une lumière qui s’allume le temps d’un calcul.

    Approfondir

    Une activation est la valeur intermédiaire produite par une couche pour une entrée donnée ; elle disparaît du chemin de calcul après l’inférence et ne doit pas être confondue avec un poids appris.

  2. 02

    A1 module

    Notion

    ALiBi

    Lecture simple

    Méthode qui ajoute dans l’attention un malus lorsque deux tokens sont éloignés.

    Approfondir

    ALiBi ajoute aux scores d’attention un biais linéaire propre à chaque tête et proportionnel à la distance, sans créer d’embedding positionnel appris séparé.

  3. 03

    A1 module

    Notion

    Alignement

    Lecture simple

    Ensemble de méthodes qui orientent le comportement d’un modèle vers des réponses plus utiles et plus sûres.

    Approfondir

    L’alignement combine objectifs, données et évaluations humaines ou synthétiques ; il améliore le comportement observé sans constituer une garantie générale de vérité ou d’innocuité.

  4. 04

    A1 module

    Notion

    Attention

    Lecture simple

    Calcul qui mesure quels tokens sont utiles pour mettre à jour la représentation d’un autre token.

    Approfondir

    L’attention compare requêtes et clés, applique une normalisation aux scores autorisés, puis forme pour chaque position une somme pondérée des valeurs.

  5. 05

    A1 module

    Notion

    Autorégressif

    Lecture simple

    Qui produit la suite une unité après l’autre en utilisant les unités déjà présentes.

    Approfondir

    Un modèle autorégressif factorise la probabilité d’une séquence en probabilités conditionnelles successives et applique un masque causal pendant l’apprentissage.

  6. 06

    B1 module

    Notion

    Backpropagation

    Lecture simple

    Méthode qui fait remonter l’erreur pour savoir comment corriger les poids.

    Approfondir

    La rétropropagation applique la règle de la chaîne au graphe de calcul afin d’obtenir le gradient de la perte par rapport à chaque paramètre entraînable.

  7. 07

    B1 module

    Notion

    Batch

    Lecture simple

    Groupe d’exemples traité ensemble pendant une étape d’entraînement.

    Approfondir

    Un batch permet de paralléliser les calculs et d’estimer un gradient moyen ; sa taille influence mémoire, bruit d’optimisation et débit d’entraînement.

  8. 08

    B1 module

    Notion

    BPE

    Lecture simple

    Famille de méthodes qui construit un vocabulaire à partir de fragments de texte fréquents.

    Approfondir

    Byte Pair Encoding fusionne itérativement des paires fréquentes pour obtenir des unités sous-lexicales ; les détails varient selon l’implémentation et le corpus.

  9. 09

    C1 module

    Notion

    Causal

    Lecture simple

    Qui empêche une prédiction d’utiliser les tokens placés dans son futur.

    Approfondir

    Une attention causale applique généralement un masque triangulaire aux scores avant softmax, assurant la factorisation autorégressive pendant l’entraînement parallèle.

  10. 10

    C1 module

    Notion

    Checkpoint

    Lecture simple

    Copie sauvegardée des poids et états utiles à un moment de l’entraînement.

    Approfondir

    Un checkpoint peut contenir paramètres, état de l’optimiseur et compteurs d’étapes afin de reprendre, évaluer ou dériver un modèle depuis un point précis.

  11. 11

    C1 module

    Notion

    Contexte

    Lecture simple

    Informations disponibles pour calculer la réponse actuelle.

    Approfondir

    Le contexte correspond aux tokens effectivement fournis dans la fenêtre courante, y compris instructions et documents récupérés, et reste distinct des paramètres et d’une mémoire produit persistante.

  12. 12

    D1 module

    Notion

    Dimension cachée

    Lecture simple

    Nombre de coordonnées utilisées dans la représentation interne d’un token.

    Approfondir

    La dimension cachée fixe la largeur principale des états du Transformer ; elle ne doit pas être confondue avec le nombre de couches, de têtes ou de paramètres.

  13. 13

    D1 module

    Notion

    DPO

    Lecture simple

    Méthode qui apprend directement à préférer certaines réponses à d’autres.

    Approfondir

    Direct Preference Optimization reformule l’objectif de préférence en classification contrastive par rapport à un modèle de référence, sans entraîner explicitement un modèle de récompense puis une politique RL.

  14. 14

    E1 module

    Notion

    Embedding

    Lecture simple

    Vecteur initial associé à un token avant les transformations contextuelles.

    Approfondir

    La table d’embeddings projette un identifiant discret dans un espace continu ; après les couches, l’état dépend aussi des autres tokens et de leur position.

  15. 15

    E1 module

    Notion

    Expert

    Lecture simple

    Sous-réseau spécialisé qu’un routeur peut activer dans une couche MoE.

    Approfondir

    Dans un MoE, un expert est généralement un bloc feed-forward distinct ; le routage épars en sélectionne quelques-uns par token et ajoute des contraintes d’équilibrage de charge.

  16. 16

    F1 module

    Notion

    Feed-forward

    Lecture simple

    Bloc qui transforme séparément chaque position après l’échange d’informations par attention.

    Approfondir

    Le réseau feed-forward applique typiquement deux projections et une non-linéarité à chaque position, avec des variantes d’activation et de largeur selon l’architecture.

  17. 17

    F1 module

    Notion

    Fenêtre de contexte

    Lecture simple

    Nombre maximal de tokens disponibles ensemble pour calculer une réponse.

    Approfondir

    La fenêtre inclut les différentes parties du prompt et les tokens générés ; dépasser la limite impose troncature, résumé ou sélection de contenu selon le système.

  18. 18

    F1 module

    Notion

    Fine-tuning

    Lecture simple

    Entraînement supplémentaire d’un modèle déjà préentraîné sur un objectif plus ciblé.

    Approfondir

    Le fine-tuning met à jour tout ou partie des paramètres avec des données spécialisées ; il peut viser une tâche, un domaine, des instructions ou des préférences.

  19. 19

    G1 module

    Notion

    GQA

    Lecture simple

    Attention où plusieurs têtes de requête partagent les mêmes clés et valeurs par groupes.

    Approfondir

    Grouped-Query Attention conserve de nombreuses têtes de requête mais réduit le nombre de têtes key-value, offrant un compromis entre qualité de MHA et mémoire d’inférence de MQA.

  20. 20

    G1 module

    Notion

    Gradient

    Lecture simple

    Indication de la direction dans laquelle chaque poids influence l’erreur.

    Approfondir

    Le gradient est le vecteur des dérivées partielles de la perte ; l’optimiseur l’utilise, avec son historique éventuel, pour choisir une mise à jour des paramètres.

  21. 21

    H1 module

    Notion

    Hallucination

    Lecture simple

    Réponse plausible mais fausse, inventée ou insuffisamment soutenue.

    Approfondir

    Le terme couvre plusieurs erreurs factuelles ou de fidélité à une source ; sa détection exige de comparer l’énoncé à une référence, pas seulement son degré d’assurance.

  22. 22

    H1 module

    Notion

    Hidden state

    Lecture simple

    Représentation interne d’un token après une ou plusieurs transformations.

    Approfondir

    L’état caché est un vecteur contextuel par position ; il évolue à chaque bloc sous l’effet de l’attention, du réseau feed-forward et des connexions résiduelles.

  23. 23

    I1 module

    Notion

    Inférence

    Lecture simple

    Moment où un modèle utilise ses poids pour produire une sortie sans les entraîner.

    Approfondir

    L’inférence exécute une passe avant, souvent répétée token par token en génération, avec des optimisations telles que batching, quantification et cache KV.

  24. 24

    K1 module

    Notion

    Key

    Lecture simple

    Vecteur comparé à une requête pour mesurer la pertinence d’une position.

    Approfondir

    Une clé provient d’une projection de l’état caché ; son produit scalaire avec une requête contribue au score d’attention avant masque et softmax.

  25. 25

    K1 module

    Notion

    KV cache

    Lecture simple

    Mémoire temporaire des clés et valeurs déjà calculées pendant une génération.

    Approfondir

    Le cache KV évite de reprojeter les positions passées à chaque nouveau token, au prix d’une mémoire qui croît avec la longueur, les couches et le nombre de têtes key-value.

  26. 26

    L1 module

    Notion

    LayerNorm

    Lecture simple

    Méthode qui recentre et remet à l’échelle les activations d’une position.

    Approfondir

    Layer Normalization normalise les coordonnées d’un exemple indépendamment du batch, puis applique des paramètres d’échelle et de biais appris.

  27. 27

    L1 module

    Notion

    LLM

    Lecture simple

    Grand modèle de langage entraîné sur beaucoup de séquences textuelles.

    Approfondir

    Un Large Language Model estime des distributions sur des tokens avec un réseau à nombreux paramètres ; le terme ne fixe ni une architecture unique ni un seuil universel de taille.

  28. 28

    L1 module

    Notion

    Logit

    Lecture simple

    Score brut attribué à un token avant sa conversion en probabilité.

    Approfondir

    Les logits sont les sorties non normalisées de la projection vers le vocabulaire ; seules leurs différences influencent la distribution produite par softmax.

  29. 29

    M1 module

    Notion

    Masque causal

    Lecture simple

    Règle qui bloque les positions futures pendant une prédiction autorégressive.

    Approfondir

    Le masque causal remplace les scores interdits par une valeur négative extrême avant softmax, donnant une matrice d’accès triangulaire inférieur.

  30. 30

    M1 module

    Notion

    MLA

    Lecture simple

    Variante d’attention multi-têtes qui compresse des informations de clés et valeurs dans un espace latent.

    Approfondir

    Multi-head Latent Attention reconstruit les représentations nécessaires depuis des codes latents afin de réduire notamment le coût du cache, selon les choix documentés de l’architecture.

  31. 31

    M1 module

    Notion

    MLP

    Lecture simple

    Petit réseau interne qui transforme chaque vecteur indépendamment des autres positions.

    Approfondir

    Dans un bloc Transformer, le MLP ou feed-forward élargit souvent la dimension, applique une non-linéarité ou une porte, puis reprojette vers la dimension cachée.

  32. 32

    M1 module

    Notion

    MoE

    Lecture simple

    Modèle ou couche avec plusieurs experts dont seulement quelques-uns sont activés pour un token.

    Approfondir

    Mixture-of-Experts augmente la capacité paramétrique tout en gardant un calcul conditionnel ; routage, équilibrage et communications ajoutent toutefois leurs propres coûts.

  33. 33

    M1 module

    Notion

    Multi-head

    Lecture simple

    Organisation de plusieurs calculs d’attention en parallèle.

    Approfondir

    L’attention multi-têtes projette états, requêtes, clés et valeurs dans plusieurs sous-espaces, concatène les sorties puis les combine par une projection.

  34. 34

    P1 module

    Notion

    Paramètre

    Lecture simple

    Nombre appris et conservé qui règle les transformations du modèle.

    Approfondir

    Les paramètres incluent matrices, vecteurs de biais ou échelles ; ils changent pendant l’entraînement mais restent normalement fixes pendant une inférence ordinaire.

  35. 35

    P1 module

    Notion

    Perte

    Lecture simple

    Mesure numérique de l’écart entre la prédiction et la cible d’entraînement.

    Approfondir

    Pour un modèle de langue, la perte est souvent une entropie croisée négative sur le prochain token ; elle guide l’optimisation sans mesurer seule l’utilité globale.

  36. 36

    P1 module

    Notion

    Poids

    Lecture simple

    Paramètre appris qui détermine comment une valeur en influence une autre.

    Approfondir

    Les poids forment principalement de grandes matrices de projection ; leur précision numérique, leur partage et leur quantification influencent mémoire et calcul.

  37. 37

    P1 module

    Notion

    Post-entraînement

    Lecture simple

    Étapes après le préentraînement qui orientent le comportement du modèle.

    Approfondir

    Le post-entraînement peut combiner SFT, préférences, filtres et évaluations ; il modifie la distribution des réponses mais ne remplace pas la vérification factuelle.

  38. 38

    P1 module

    Notion

    Préentraînement

    Lecture simple

    Grande phase d’apprentissage général sur de nombreuses séquences.

    Approfondir

    Le préentraînement optimise à grande échelle un objectif tel que la prédiction du prochain token, produisant des représentations et capacités réutilisables.

  39. 39

    P1 module

    Notion

    Prompt

    Lecture simple

    Texte, données et consignes fournis au système pour une tâche.

    Approfondir

    Le prompt peut contenir instructions, exemples et contexte récupéré ; son effet reste conditionné par la fenêtre disponible, le modèle et les règles de priorité du produit.

  40. 40

    Q1 module

    Notion

    Quantification

    Lecture simple

    Technique qui représente les poids ou activations avec moins de bits.

    Approfondir

    La quantification réduit stockage, bande passante et parfois calcul, avec une erreur d’approximation dont l’impact dépend de la granularité et de la calibration.

  41. 41

    Q1 module

    Notion

    Query

    Lecture simple

    Vecteur qui représente ce qu’une position cherche chez les autres positions.

    Approfondir

    Une requête est obtenue par projection de l’état courant et comparée aux clés, généralement par produit scalaire mis à l’échelle.

  42. 42

    R1 module

    Notion

    RAG

    Lecture simple

    Méthode qui récupère des documents puis les ajoute au contexte avant de générer.

    Approfondir

    Retrieval-Augmented Generation sépare recherche et génération ; ses résultats dépendent de l’index, du classement, des documents et de la fidélité de la synthèse.

  43. 43

    R1 module

    Notion

    Résiduel

    Lecture simple

    Connexion qui ajoute l’entrée d’une sous-couche à sa transformation.

    Approfondir

    Une connexion résiduelle crée un chemin direct pour l’information et les gradients ; son placement par rapport à la normalisation varie selon les architectures.

  44. 44

    R1 module

    Notion

    RLHF

    Lecture simple

    Méthodes qui utilisent des préférences humaines pour orienter les réponses.

    Approfondir

    Le RLHF classique entraîne un modèle de récompense à partir de comparaisons puis optimise la politique ; il aligne des préférences mesurées sans garantir la vérité.

  45. 45

    R1 module

    Notion

    RMSNorm

    Lecture simple

    Normalisation fondée sur la racine de la moyenne des carrés.

    Approfondir

    RMSNorm remet l’échelle d’un vecteur à partir de sa norme quadratique moyenne sans soustraire explicitement sa moyenne, ce qui réduit certaines opérations de LayerNorm.

  46. 46

    R1 module

    Notion

    RoPE

    Lecture simple

    Méthode qui encode la position en faisant tourner les requêtes et les clés.

    Approfondir

    Rotary Position Embedding applique des rotations dépendantes de la position par paires de dimensions, faisant apparaître la distance relative dans les produits scalaires.

  47. 47

    R1 module

    Notion

    Routeur

    Lecture simple

    Partie d’un MoE qui choisit les experts sollicités pour chaque token.

    Approfondir

    Le routeur calcule des scores, retient généralement un petit top-k et doit gérer capacité et équilibrage pour éviter de surcharger quelques experts.

  48. 48

    S1 module

    Notion

    Sampling

    Lecture simple

    Choix du prochain token en tirant dans une distribution plutôt qu’en prenant toujours le premier.

    Approfondir

    L’échantillonnage peut être combiné avec température, top-k ou top-p ; il introduit de la diversité sans changer les connaissances inscrites dans les poids.

  49. 49

    S1 module

    Notion

    SFT

    Lecture simple

    Fine-tuning supervisé sur des exemples de réponses attendues.

    Approfondir

    Supervised Fine-Tuning optimise directement la vraisemblance de démonstrations choisies et sert souvent de première étape du post-entraînement instructionnel.

  50. 50

    S1 module

    Notion

    Softmax

    Lecture simple

    Fonction qui transforme une liste de scores en poids positifs dont la somme vaut un.

    Approfondir

    Softmax exponentie les scores relatifs puis normalise leur somme ; elle sert dans l’attention et dans la distribution de sortie, avec des rôles distincts.

  51. 51

    S1 module

    Notion

    Superposition

    Lecture simple

    Situation où plusieurs caractéristiques partagent les mêmes dimensions internes.

    Approfondir

    La superposition permet à un réseau de représenter davantage de caractéristiques que ses axes directement lisibles, ce qui complique l’interprétation neurone par neurone.

  52. 52

    T1 module

    Notion

    Température

    Lecture simple

    Réglage qui aplatit ou concentre la distribution des choix possibles.

    Approfondir

    Diviser les logits par une température positive avant softmax modifie leur contraste : une valeur basse concentre, une valeur haute diversifie.

  53. 53

    T1 module

    Notion

    Token

    Lecture simple

    Unité de texte manipulée par le modèle, parfois mot, fragment, signe ou espace.

    Approfondir

    Le token est un identifiant dans un vocabulaire propre au tokenizer ; sa frontière dépend de l’encodage, de la langue et du modèle considéré.

  54. 54

    T1 module

    Notion

    Tokenizer

    Lecture simple

    Outil qui transforme le texte en identifiants de tokens et effectue l’opération inverse.

    Approfondir

    Un tokenizer définit normalisation, algorithme de segmentation, vocabulaire et tokens spéciaux ; deux modèles peuvent découper la même chaîne différemment.

  55. 55

    T1 module

    Notion

    Top-p

    Lecture simple

    Décodage qui conserve le plus petit groupe de tokens couvrant une masse de probabilité donnée.

    Approfondir

    Le nucleus sampling trie les probabilités puis limite le tirage au préfixe cumulatif atteignant p, ce qui adapte le nombre de candidats à la distribution.

  56. 56

    T1 module

    Notion

    Transformer

    Lecture simple

    Architecture qui traite les relations entre positions grâce à l’attention et à des blocs répétés.

    Approfondir

    Le Transformer original combine attention, réseaux feed-forward, positions, résidus et normalisation ; les LLM modernes en utilisent de nombreuses variantes.

  57. 57

    V1 module

    Notion

    Value

    Lecture simple

    Vecteur d’information mélangé selon les poids calculés par l’attention.

    Approfondir

    Une valeur provient d’une projection de l’état caché ; la sortie d’attention est une combinaison pondérée des valeurs autorisées pour chaque requête.

  58. 58

    V1 module

    Notion

    Vocabulaire

    Lecture simple

    Liste finie des tokens que le tokenizer et le modèle savent coder.

    Approfondir

    Le vocabulaire associe chaque unité à un identifiant et fixe la taille de plusieurs matrices, sans contenir à lui seul les significations contextuelles apprises.

  59. 59

    V1 module

    Notion

    Vocabulaire de sortie

    Lecture simple

    Ensemble des tokens auxquels le modèle attribue un score pour choisir la suite.

    Approfondir

    La projection finale produit un logit par entrée du vocabulaire, souvent avec des poids liés à la table d’embeddings selon l’architecture.