TRANSFORMERS — comprendre l’attention
transforme les mots.
Une plongée visuelle
au cœur de l’attention.
relier le contexte.
Un mot ne voyage
jamais seul.
Dans « l’avocat prépare sa plaidoirie », le contexte nous guide vers un métier. Dans « l’avocat mûrit dans la cuisine », il nous guide vers un fruit. Pour un modèle, ce contexte doit devenir un calcul.
Ce cours suit un Transformer de langage autorégressif : il transforme une séquence en représentations contextualisées, puis propose le token suivant. C’est une variante de l’architecture, pas la définition de tous les Transformers. [1]
Représenter
Les mots deviennent
des coordonnées.
Le texte est découpé en tokens : mots, fragments ou signes de ponctuation. Une table apprise associe chaque token à un vecteur, son embedding. On peut se représenter ces vecteurs comme des points dans un espace à nombreuses dimensions. [1]
La position compte aussi : « le chat poursuit le chien » et « le chien poursuit le chat » contiennent les mêmes mots. Une information de position permet au réseau de distinguer leur ordre. Dans le Transformer original, elle est ajoutée aux embeddings. [4]
Le vecteur initial identifie un token. Les couches suivantes vont le modifier en fonction de ce qui l’entoure. Les coordonnées de la démonstration sont un support de lecture, pas un dictionnaire de propriétés linguistiques.
dans les relations.
Mettre en relation
À quoi faut-il
prêter attention ?
L’attention produit une mise à jour pour chaque position. Trois projections apprises du même état jouent trois rôles : la requête Q est comparée aux clés K ; les poids obtenus servent à mélanger les valeurs V. Ces rôles sont une façon de lire le calcul, sans supposer une intention du modèle. [2]
Le produit scalaire mesure la compatibilité d’une requête avec une clé. On divise les scores par √dₖ pour contrôler leur échelle, puis softmax les transforme en poids positifs dont la somme vaut 1. La sortie est une somme pondérée des valeurs. [2]
La requête
Ce que cette position recherche.
Q = XWQLa clé
Ce à quoi elle peut correspondre.
K = XWKLa valeur
L’information à transmettre.
V = XWVChaque ligne correspond à une requête. M vaut 0 sur les positions autorisées et −∞ sur les positions masquées.
Choisissez le token qui reçoit l’information.
Voir les scores et les poids
| Token | q · k / √2 | Poids α |
|---|---|---|
| Le · 1 | 0.269 | 9.2 % |
| chat · 2 | 2.333 | 72.2 % |
| dort · 3 | 0.976 | 18.6 % |
| sur · 4 | −∞ | 0.0 % |
| le · 5 | −∞ | 0.0 % |
| tapis · 6 | −∞ | 0.0 % |
Le futur reste caché.
Pour prédire le prochain token, une position ne doit pas accéder aux suivants. Le masque causal bloque ces liens avant softmax : leur poids devient nul. Dans le laboratoire, sélectionnez « dort » puis retirez le masque pour voir apparaître les trois positions suivantes. [2]
Plusieurs têtes, plusieurs mélanges.
Chaque tête utilise ses propres projections. Leurs sorties sont concaténées puis projetées ensemble. Comparez les têtes de la démonstration : un même token reçoit deux mélanges différents. Dans un modèle entraîné, on n’impose pas à chaque tête une fonction linguistique précise. [2]
Assembler
Une couche relie.
La suivante affine.
Relier, puis transformer.
L’attention échange de l’information entre positions. Le réseau feed-forward applique ensuite une transformation non linéaire à chaque position, avec les mêmes paramètres. Les connexions résiduelles ajoutent la sortie d’un sous-bloc à son entrée ; les normalisations contrôlent l’échelle des activations. [4]
Au fil des blocs, les représentations évoluent. À la sortie, une projection fournit un score par token du vocabulaire. Un softmax donne la distribution de la prochaine continuation. [1]
Dessiner les matrices et suivre leurs dimensions aide à voir où l’information circule et ce qu’elle coûte en mémoire. Son exploration de l’attention latente de DeepSeek prolonge cette lecture jusqu’au cache des clés et valeurs. [3]
Continuer
Et maintenant,
quel token ?
Le réseau produit des possibilités. Choisir systématiquement la plus probable donne un décodage glouton ; échantillonner permet d’autres continuations. Le token retenu rejoint le contexte, et le processus recommence. [1]
Faites varier le choix.
Dans notre exemple, « dort » a le score le plus élevé. À température basse, sa probabilité domine. Montez le curseur : les candidats moins favorisés deviennent plus présents. Le classement reste identique, car les scores sont fixes.
Refaites plusieurs tirages à la même température. Le mot obtenu peut changer alors que les probabilités sont inchangées. La formule de ce module est pᵢ = exp(zᵢ / T) / Σⱼ exp(zⱼ / T), avec T strictement positif.
Le chat …
Pendant l’entraînement d’un modèle de langage causal, on compare les prédictions aux tokens réellement suivants, puis la rétropropagation ajuste les paramètres pour réduire l’erreur. Pendant la génération ordinaire, ces paramètres restent fixes : c’est le contexte qui s’allonge. [1]
Ce qui reste
Représenter.
Relier. Prédire.
Pour relire un schéma de Transformer, suivez trois questions : quelle représentation entre dans le bloc, quelles positions peuvent échanger, et quelle transformation produit la sortie ? Les matrices deviennent alors un trajet que l’on peut suivre.
Revenir au laboratoirePour aller plus loin
Les idées se partagent.
Un cours original, inspiré de la pédagogie visuelle de 3Blue1Brown et Welch Labs. Les schémas de cette page sont créés pour le portfolio.