Guide / Fiches

Architecture Transformer

Attention, encodage positionnel, mélange d'experts, arbitrages architecturaux.

↓ Télécharger cette fiche (.txt)

Attention

Un mécanisme qui permet à un modèle de pondérer la pertinence de chaque autre token lors du traitement d'un token donné.

ex. Dans « Le chat s'est assis parce qu'il était fatigué », l'attention relie « il » à « chat ».

Feed-Forward Network (FFN)

La couche entièrement connectée par token à l'intérieur de chaque bloc transformer, qui suit l'attention et ajoute une capacité de traitement non linéaire.

ex. Environ les deux tiers des paramètres d'un transformer se trouvent généralement ici.

Layer Normalization

Une technique qui redimensionne les activations au sein d'une couche pour stabiliser et accélérer l'entraînement des réseaux profonds.

ex. Appliquée avant ou après chaque sous-bloc d'attention/FFN.

Mixture of Experts (MoE)

Une architecture où seul un sous-ensemble de sous-réseaux « experts » spécialisés s'active par token, augmentant la capacité sans coût de calcul proportionnel.

ex. Un modèle à 8 experts peut router chaque token à travers seulement 2 d'entre eux.

Positional Encoding

Une information ajoutée aux représentations des tokens pour que le modèle connaisse l'ordre des mots, l'attention seule étant indifférente à l'ordre.

ex. Le RoPE (encodage positionnel rotatif) est utilisé dans de nombreux LLM modernes.

Self-Attention

L'attention appliquée au sein d'une même séquence, permettant à chaque token de porter attention à tous les autres tokens de la même entrée.

ex. Résoudre les références pronominales dans un paragraphe.