Intelligence artificielleDes mots. Des liens. Du sens.

TRANSFORMERS — comprendre l’attention

Le contexte
transforme les mots.

Une plongée visuelle
au cœur de l’attention.

Commencer la lecture
01Une idée centrale :
relier le contexte.
Avant les équations

Un mot ne voyage
jamais seul.

Dans « l’avocat prépare sa plaidoirie », le contexte nous guide vers un métier. Dans « l’avocat mûrit dans la cuisine », il nous guide vers un fruit. Pour un modèle, ce contexte doit devenir un calcul.

Ce cours suit un Transformer de langage autorégressif : il transforme une séquence en représentations contextualisées, puis propose le token suivant. C’est une variante de l’architecture, pas la définition de tous les Transformers. [1]

01

Représenter

Les mots deviennent
des coordonnées.

Le texte est découpé en tokens : mots, fragments ou signes de ponctuation. Une table apprise associe chaque token à un vecteur, son embedding. On peut se représenter ces vecteurs comme des points dans un espace à nombreuses dimensions. [1]

La position compte aussi : « le chat poursuit le chien » et « le chien poursuit le chat » contiennent les mêmes mots. Une information de position permet au réseau de distinguer leur ordre. Dans le Transformer original, elle est ajoutée aux embeddings. [4]

01 / Du texte aux nombresÀ manipuler
chat
1.20.8-0.30.5

Un token
quatre coordonnées.

Choisissez un mot. Les vecteurs sont inventés et limités à quatre dimensions pour la lecture. Les deux « le » partagent ici le même embedding ; leur position les distinguera. Le découpage mot par mot est simplifié.
À retenir

Le vecteur initial identifie un token. Les couches suivantes vont le modifier en fonction de ce qui l’entoure. Les coordonnées de la démonstration sont un support de lecture, pas un dictionnaire de propriétés linguistiques.

Du mot isolé
Le sens se construit
dans les relations.
au mot en contexte.
02

Mettre en relation

À quoi faut-il
prêter attention ?

L’attention produit une mise à jour pour chaque position. Trois projections apprises du même état jouent trois rôles : la requête Q est comparée aux clés K ; les poids obtenus servent à mélanger les valeurs V. Ces rôles sont une façon de lire le calcul, sans supposer une intention du modèle. [2]

Le produit scalaire mesure la compatibilité d’une requête avec une clé. On divise les scores par √dₖ pour contrôler leur échelle, puis softmax les transforme en poids positifs dont la somme vaut 1. La sortie est une somme pondérée des valeurs. [2]

Q

La requête

Ce que cette position recherche.

Q = XWQ
K

La clé

Ce à quoi elle peut correspondre.

K = XWK
V

La valeur

L’information à transmettre.

V = XWV
Attention(Q, K, V)= softmax(QKᵀ / √dₖ + M) V

Chaque ligne correspond à une requête. M vaut 0 sur les positions autorisées et −∞ sur les positions masquées.

02 / Le laboratoire d’attentionCalcul en direct

Choisissez le token qui reçoit l’information.

9.2 %72.2 %18.6 %masquémasquémasquédort
q = [1.8 ; 0.2]Sortie Σ αᵢvᵢ = [0.932 ; -0.066]
Voir les scores et les poids
Poids normalisés pour « dort », position 3
Tokenq · k / √2Poids α
Le · 10.2699.2 %
chat · 22.33372.2 %
dort · 30.97618.6 %
sur · 4−∞0.0 %
le · 5−∞0.0 %
tapis · 6−∞0.0 %
Petit modèle à deux dimensions, avec Q, K et V fixés à la main. Les poids sont réellement calculés par softmax ; ils ne décrivent pas un modèle entraîné. Désactivez le masque pour autoriser les positions futures et comparez les deux têtes.

Le futur reste caché.

Pour prédire le prochain token, une position ne doit pas accéder aux suivants. Le masque causal bloque ces liens avant softmax : leur poids devient nul. Dans le laboratoire, sélectionnez « dort » puis retirez le masque pour voir apparaître les trois positions suivantes. [2]

Plusieurs têtes, plusieurs mélanges.

Chaque tête utilise ses propres projections. Leurs sorties sont concaténées puis projetées ensemble. Comparez les têtes de la démonstration : un même token reçoit deux mélanges différents. Dans un modèle entraîné, on n’impose pas à chaque tête une fonction linguistique précise. [2]

03

Assembler

Une couche relie.
La suivante affine.

Tokens + positions
Un bloc · variante pré-normalisée
Normalisation
Attention multi-tête
+ connexion résiduelle
Normalisation
Réseau feed-forward
+ connexion résiduelle
↻ Répéter sur plusieurs blocs
Normalisation → projection → softmax
Trajet simplifié d’un décodeur autorégressif pré-normalisé. La place de la normalisation varie selon les architectures.

Relier, puis transformer.

L’attention échange de l’information entre positions. Le réseau feed-forward applique ensuite une transformation non linéaire à chaque position, avec les mêmes paramètres. Les connexions résiduelles ajoutent la sortie d’un sous-bloc à son entrée ; les normalisations contrôlent l’échelle des activations. [4]

Au fil des blocs, les représentations évoluent. À la sortie, une projection fournit un score par token du vocabulaire. Un softmax donne la distribution de la prochaine continuation. [1]

Le regard de Welch Labs

Dessiner les matrices et suivre leurs dimensions aide à voir où l’information circule et ce qu’elle coûte en mémoire. Son exploration de l’attention latente de DeepSeek prolonge cette lecture jusqu’au cache des clés et valeurs. [3]

04

Continuer

Et maintenant,
quel token ?

Le réseau produit des possibilités. Choisir systématiquement la plus probable donne un décodage glouton ; échantillonner permet d’autres continuations. Le token retenu rejoint le contexte, et le processus recommence. [1]

Faites varier le choix.

Dans notre exemple, « dort » a le score le plus élevé. À température basse, sa probabilité domine. Montez le curseur : les candidats moins favorisés deviennent plus présents. Le classement reste identique, car les scores sont fixes.

Refaites plusieurs tirages à la même température. Le mot obtenu peut changer alors que les probabilités sont inchangées. La formule de ce module est pᵢ = exp(zᵢ / T) / Σⱼ exp(zⱼ / T), avec T strictement positif.

03 / Plusieurs suites possiblesÀ manipuler

Le chat

dort54.8 %
joue22.3 %
mange12.2 %
observe6.7 %
court4.1 %
Cinq candidats et des scores fictifs, gardés fixes. La température modifie leur distribution, puis le bouton effectue un tirage. Une température basse concentre les choix ; une température haute les répartit davantage. Ce module n’exécute pas de LLM.
Et l’apprentissage ?

Pendant l’entraînement d’un modèle de langage causal, on compare les prédictions aux tokens réellement suivants, puis la rétropropagation ajuste les paramètres pour réduire l’erreur. Pendant la génération ordinaire, ces paramètres restent fixes : c’est le contexte qui s’allonge. [1]

Ce qui reste

Représenter.
Relier. Prédire.

Pour relire un schéma de Transformer, suivez trois questions : quelle représentation entre dans le bloc, quelles positions peuvent échanger, et quelle transformation produit la sortie ? Les matrices deviennent alors un trajet que l’on peut suivre.

Revenir au laboratoire

Pour aller plus loin

Les idées se partagent.

Un cours original, inspiré de la pédagogie visuelle de 3Blue1Brown et Welch Labs. Les schémas de cette page sont créés pour le portfolio.

  1. [1] 3Blue1BrownTransformers, the tech behind LLMs · Chapitre 5
  2. [2] 3Blue1BrownAttention in transformers, step-by-step · Chapitre 6
  3. [3] Welch LabsHow DeepSeek Rewrote the Transformer [MLA]
  4. [4] Vaswani et al. · 2017Attention Is All You Need · Article fondateur