AI ProdigiesCours interactifs
Ouvrir la navigation
Module 10 · Leçon 333 min · intermediaire

Produit matriciel, non-linéarité et dimensions

Calculer un petit produit ligne-colonne, suivre les formes et comprendre pourquoi les non-linéarités donnent de la profondeur au réseau.

Sommaire et raccourcis

Objectifs d’apprentissage

Objectifs de la leçon

  • Calculer une case d’un produit matriciel
  • Vérifier la compatibilité des dimensions et le rôle d’une non-linéarité

Prérequis

  • Leçon 10.2

Produit matriciel, non-linéarité et dimensions

Situation concrète

La majorité des transformations d’un LLM réutilisent une opération simple à décrire : multiplier des entrées par une matrice de poids, puis appliquer d’autres opérations.

Objectifs d’apprentissage

  • Calculer une case d’un produit matriciel
  • Vérifier la compatibilité des dimensions et le rôle d’une non-linéarité

Prérequis

  • Leçon 10.2

Mode simple

Pour calculer une case du résultat, prenez une ligne de la première matrice et une colonne de la seconde. Multipliez les nombres face à face puis additionnez. Une matrice n × d multipliée par une matrice d × k produit une matrice n × k : les dimensions intérieures doivent correspondre. Si l’on empilait seulement des transformations linéaires, elles pourraient se réduire à une seule. Les fonctions non linéaires permettent de construire des relations plus riches entre les couches.

Mode approfondi

Une projection affine Y = XW + b transforme la dernière dimension. Dans l’attention, les matrices WQ, WK et WV produisent des sous-espaces ; dans le MLP, une expansion d → dff, une activation ou une porte, puis une contraction dff → d augmentent la capacité de calcul. ReLU, GELU et SwiGLU ont des propriétés différentes. Une « couche » désigne une étape fonctionnelle ou un bloc selon le contexte, ce qui interdit de comparer des comptes sans définition.

Analogie

Chaque ligne est une recette et chaque colonne un filtre : les produits mesurent les rencontres ingrédient-filtre, puis l’addition forme une nouvelle caractéristique.

Exemple concret

[2, 3] multiplié par la colonne [4, 5] donne 2×4 + 3×5 = 23. La ligne possède deux éléments parce que la colonne en possède deux.

Une case, une ligne et une colonne — Une grille surligne les deux éléments d’une ligne et les deux d’une colonne, puis déroule produits et somme.

La ligne 2, 3 croise la colonne 4, 5 ; les calculs 8 et 15 convergent vers la case résultat 23.

Activité manipulable

Manipulez l’activité « matrix-multiplication-lab », validez votre réponse puis expliquez ce que le résultat démontre et ce qu’il ne démontre pas.

Confusion fréquente

Le nombre de couches ne peut pas être déduit d’une dimension de matrice. Profondeur, largeur, têtes et vocabulaire décrivent des axes différents.

Vérification rapide

Pourquoi les dimensions intérieures doivent-elles être égales ?

Chaque élément d’une ligne doit rencontrer exactement un élément de la colonne. Le nombre de produits terme à terme doit donc coïncider.

Résumé

  • Le produit matriciel combine lignes et colonnes.
  • Les formes permettent de vérifier une opération.
  • Les non-linéarités empêchent une pile de se réduire à une projection unique.

Mots du glossaire

Sources

Vue matrix

Une case, une ligne et une colonne

Une grille surligne les deux éléments d’une ligne et les deux d’une colonne, puis déroule produits et somme.

Notions associées

  1. produit matriciel
  2. projection
  3. fonction non linéaire

Description de la figure

La ligne 2, 3 croise la colonne 4, 5 ; les calculs 8 et 15 convergent vers la case résultat 23.

Manipuler pour comprendre

Activité interactive

Activité interactive

Calcul exact

Multiplication matricielle visuelle

Observe comment une ligne rencontre une colonne, puis calcule toi-même les quatre cases de la matrice résultat.

Deux matrices deux par deux sont affichées. Dans l’exemple guidé, une ligne bleue et une colonne ambre indiquent les valeurs à multiplier. Un exercice propose ensuite quatre champs numériques à compléter.

Exemple guidé

Une ligne × une colonne

12
34
21
10

À toi de jouer

Complète A × B

21
03
14
21

Une matrice transforme plusieurs nombres en parallèle. Ici, chaque résultat reste traçable jusqu’à une ligne et une colonne précises.

Vérification rapide

Combien vaut le produit de la ligne [2, 3] par la colonne [4, 5] ?

À garder sous la main

Mots du glossaire

Ouvrir tout le glossaire →
Activation

Nombre temporaire calculé pendant une réponse, comme une lumière qui s’allume le temps d’un calcul.

Une activation est la valeur intermédiaire produite par une couche pour une entrée donnée ; elle disparaît du chemin de calcul après l’inférence et ne doit pas être confondue avec un poids appris.

Voir les liens associés
Dimension cachée

Nombre de coordonnées utilisées dans la représentation interne d’un token.

La dimension cachée fixe la largeur principale des états du Transformer ; elle ne doit pas être confondue avec le nombre de couches, de têtes ou de paramètres.

Voir les liens associés
MLP

Petit réseau interne qui transforme chaque vecteur indépendamment des autres positions.

Dans un bloc Transformer, le MLP ou feed-forward élargit souvent la dimension, applique une non-linéarité ou une porte, puis reprojette vers la dimension cachée.

Voir les liens associés
Poids

Paramètre appris qui détermine comment une valeur en influence une autre.

Les poids forment principalement de grandes matrices de projection ; leur précision numérique, leur partage et leur quantification influencent mémoire et calcul.

Voir les liens associés
RSources de la leçon2 références, avec portée et date de vérification
  1. R1Source primaireVérifiée le 2026-07-18

    Vaswani, A. et al.. Attention Is All You Need (2017).

    Texte fondateur pour l’attention multi-têtes, les positions, le bloc feed-forward et la complexité du Transformer.

    Consulter la source dans un nouvel onglet
  2. R10Source primaireVérifiée le 2026-07-18

    Zhang, B. et Sennrich, R.. Root Mean Square Layer Normalization (2019).

    Source de RMSNorm, utile pour comparer les objectifs et calculs des variantes de normalisation dans les réseaux profonds.

    Consulter la source dans un nouvel onglet

Relevé de progression

Prêt à fixer cette étape ?

La progression reste enregistrée sur cet appareil, même sans compte.

Cette leçon est en cours.