================================================================ AI FLUENCY — FICHE DE RÉVISION Architecture Transformer ================================================================ Attention, encodage positionnel, mélange d'experts, arbitrages architecturaux. 6 termes ---------------------------------------------------------------- * Attention Un mécanisme qui permet à un modèle de pondérer la pertinence de chaque autre token lors du traitement d'un token donné. ex. Dans « Le chat s'est assis parce qu'il était fatigué », l'attention relie « il » à « chat ». * Feed-Forward Network (FFN) La couche entièrement connectée par token à l'intérieur de chaque bloc transformer, qui suit l'attention et ajoute une capacité de traitement non linéaire. ex. Environ les deux tiers des paramètres d'un transformer se trouvent généralement ici. * Layer Normalization Une technique qui redimensionne les activations au sein d'une couche pour stabiliser et accélérer l'entraînement des réseaux profonds. ex. Appliquée avant ou après chaque sous-bloc d'attention/FFN. * Mixture of Experts (MoE) Une architecture où seul un sous-ensemble de sous-réseaux « experts » spécialisés s'active par token, augmentant la capacité sans coût de calcul proportionnel. ex. Un modèle à 8 experts peut router chaque token à travers seulement 2 d'entre eux. * Positional Encoding Une information ajoutée aux représentations des tokens pour que le modèle connaisse l'ordre des mots, l'attention seule étant indifférente à l'ordre. ex. Le RoPE (encodage positionnel rotatif) est utilisé dans de nombreux LLM modernes. * Self-Attention L'attention appliquée au sein d'une même séquence, permettant à chaque token de porter attention à tous les autres tokens de la même entrée. ex. Résoudre les références pronominales dans un paragraphe. ---------------------------------------------------------------- Astuce : collez ce fichier dans votre assistant IA préféré et demandez un tutorat.