Attention
Un mécanisme qui permet à un modèle de pondérer la pertinence de chaque autre token lors du traitement d'un token donné.
ex. Dans « Le chat s'est assis parce qu'il était fatigué », l'attention relie « il » à « chat ».Attention, encodage positionnel, mélange d'experts, arbitrages architecturaux.
Un mécanisme qui permet à un modèle de pondérer la pertinence de chaque autre token lors du traitement d'un token donné.
ex. Dans « Le chat s'est assis parce qu'il était fatigué », l'attention relie « il » à « chat ».La couche entièrement connectée par token à l'intérieur de chaque bloc transformer, qui suit l'attention et ajoute une capacité de traitement non linéaire.
ex. Environ les deux tiers des paramètres d'un transformer se trouvent généralement ici.Une technique qui redimensionne les activations au sein d'une couche pour stabiliser et accélérer l'entraînement des réseaux profonds.
ex. Appliquée avant ou après chaque sous-bloc d'attention/FFN.Une architecture où seul un sous-ensemble de sous-réseaux « experts » spécialisés s'active par token, augmentant la capacité sans coût de calcul proportionnel.
ex. Un modèle à 8 experts peut router chaque token à travers seulement 2 d'entre eux.Une information ajoutée aux représentations des tokens pour que le modèle connaisse l'ordre des mots, l'attention seule étant indifférente à l'ordre.
ex. Le RoPE (encodage positionnel rotatif) est utilisé dans de nombreux LLM modernes.L'attention appliquée au sein d'une même séquence, permettant à chaque token de porter attention à tous les autres tokens de la même entrée.
ex. Résoudre les références pronominales dans un paragraphe.