Frontière

La Frontière

Les articles qui ont construit ce domaine — choisis à la main, avec une ligne honnête sur l’importance de chacun.


2017-06Vaswani et al.Architecture Transformer

Attention Is All You Need

A introduit le Transformer — une architecture encodeur/décodeur reposant entièrement sur l'auto-attention, sans récurrence — qui sous-tend pratiquement tous les LLM modernes.

Lire l’article →

2020-05Brown et al.Fondamentaux de l'IA

Language Models are Few-Shot Learners

A montré que faire passer un transformer décodeur seul à 175 milliards de paramètres débloque un apprentissage few-shot et en contexte performant, sans fine-tuning spécifique à la tâche.

Lire l’article →

2020-05Lewis et al.RAG et recherche documentaire

Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

A associé un modèle seq2seq pré-entraîné à un module de recherche dense appris sur un index vectoriel — le schéma que suivent encore les pipelines RAG modernes.

Lire l’article →

2022-03Ouyang et al.Sécurité et alignement

Training Language Models to Follow Instructions with Human Feedback

A introduit la recette de fine-tuning RLHF utilisée pour que les modèles de base suivent des instructions et privilégient des réponses utiles et honnêtes — la technique derrière ChatGPT.

Lire l’article →

2022-01Wei et al.Techniques de prompting

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

A montré que demander à un modèle de produire des étapes de raisonnement intermédiaires, plutôt que de sauter directement à la réponse, améliore nettement la résolution de problèmes à plusieurs étapes.

Lire l’article →

2022-10Yao et al.Agents et utilisation d'outils

ReAct: Synergizing Reasoning and Acting in Language Models

Entrelace des traces de raisonnement avec des actions d'appel d'outils et des observations — la boucle sur laquelle reposent la plupart des frameworks d'agents modernes.

Lire l’article →

2022-12Bai et al.Sécurité et alignement

Constitutional AI: Harmlessness from AI Feedback

Remplace une grande partie du feedback humain par des critiques générées par l'IA, jugées à l'aune d'une constitution écrite, réduisant la dépendance aux annotateurs humains pour l'entraînement à la sécurité.

Lire l’article →

2022-03Wang et al.Techniques de prompting

Self-Consistency Improves Chain of Thought Reasoning in Language Models

Échantillonne plusieurs chemins de raisonnement chain-of-thought différents pour la même question et retient la réponse majoritaire, échangeant du calcul supplémentaire contre une meilleure précision.

Lire l’article →