Attention Is All You Need
A introduit le Transformer — une architecture encodeur/décodeur reposant entièrement sur l'auto-attention, sans récurrence — qui sous-tend pratiquement tous les LLM modernes.
Lire l’article →Frontière
Les articles qui ont construit ce domaine — choisis à la main, avec une ligne honnête sur l’importance de chacun.
A introduit le Transformer — une architecture encodeur/décodeur reposant entièrement sur l'auto-attention, sans récurrence — qui sous-tend pratiquement tous les LLM modernes.
Lire l’article →A montré que faire passer un transformer décodeur seul à 175 milliards de paramètres débloque un apprentissage few-shot et en contexte performant, sans fine-tuning spécifique à la tâche.
Lire l’article →A associé un modèle seq2seq pré-entraîné à un module de recherche dense appris sur un index vectoriel — le schéma que suivent encore les pipelines RAG modernes.
Lire l’article →A introduit la recette de fine-tuning RLHF utilisée pour que les modèles de base suivent des instructions et privilégient des réponses utiles et honnêtes — la technique derrière ChatGPT.
Lire l’article →A montré que demander à un modèle de produire des étapes de raisonnement intermédiaires, plutôt que de sauter directement à la réponse, améliore nettement la résolution de problèmes à plusieurs étapes.
Lire l’article →Entrelace des traces de raisonnement avec des actions d'appel d'outils et des observations — la boucle sur laquelle reposent la plupart des frameworks d'agents modernes.
Lire l’article →Remplace une grande partie du feedback humain par des critiques générées par l'IA, jugées à l'aune d'une constitution écrite, réduisant la dépendance aux annotateurs humains pour l'entraînement à la sécurité.
Lire l’article →Échantillonne plusieurs chemins de raisonnement chain-of-thought différents pour la même question et retient la réponse majoritaire, échangeant du calcul supplémentaire contre une meilleure précision.
Lire l’article →