Catastrophic Forgetting
La tendance d'un réseau de neurones à écraser des connaissances générales précédemment apprises lorsqu'il est entièrement affiné sur un nouveau jeu de données restreint.
ex. Un modèle perdant sa capacité conversationnelle générale après un fine-tuning intensif sur des documents juridiques.DPO (Direct Preference Optimization)
Une méthode qui affine directement un modèle sur des paires de réponses choisie/rejetée, sans entraîner de modèle de récompense séparé ni exécuter d'apprentissage par renforcement.
ex. Entraîner un modèle à préférer l'une de deux réponses candidates à l'aide d'une seule perte de type classification.Fine-Tuning
Poursuivre l'entraînement d'un modèle pré-entraîné sur un jeu de données plus restreint, spécifique à une tâche ou à un domaine, afin de spécialiser son comportement.
ex. Prendre un modèle généraliste et poursuivre son entraînement sur des transcriptions de support client.Instruction Tuning
Affiner un modèle de base sur des paires (instruction, réponse) afin qu'il suive de manière fiable des directives en langage naturel.
ex. Transformer un modèle brut de complétion de texte en un assistant utile.LoRA (Low-Rank Adaptation)
Une technique PEFT qui injecte de petites matrices entraînables de rang faible dans les couches de poids d'un modèle, au lieu de mettre à jour les poids complets.
ex. Adapter le style d'un modèle avec un fichier LoRA de quelques centaines de mégaoctets.PEFT (Parameter-Efficient Fine-Tuning)
Une famille de méthodes de fine-tuning qui entraînent un petit ensemble de paramètres supplémentaires tout en gardant figée la majorité des poids du modèle de base.
ex. Affiner un modèle de 70 milliards de paramètres en n'entraînant que quelques millions de paramètres d'adaptateur.