Constitutional AI
Une approche d'alignement où un modèle critique et révise ses propres résultats par rapport à un ensemble écrit de principes, réduisant ainsi la dépendance à l'étiquetage humain pour chaque cas.
ex. Un modèle vérifiant sa propre réponse par rapport à une règle comme « éviter les instructions nuisibles ».Guardrails
Des contrôles automatisés (filtres, classificateurs, règles) placés autour d'un modèle pour détecter ou bloquer les résultats dangereux ou non conformes à la politique.
ex. Un filtre de contenu bloquant une réponse avant qu'elle n'atteigne l'utilisateur.Jailbreak
Un prompt conçu pour contourner l'entraînement de sécurité d'un modèle et l'amener à produire du contenu interdit.
ex. Déguiser une demande nuisible en « histoire fictive ».Prompt Injection
Une attaque où des instructions malveillantes sont dissimulées dans un contenu traité par un modèle (une page web, un document, un e-mail) afin de détourner son comportement.
ex. Une page web contenant du texte caché indiquant à un assistant IA de divulguer des données privées.Red Teaming
Sonder délibérément un modèle ou un système à la recherche de faiblesses, de résultats nuisibles ou de comportements exploitables avant son déploiement.
ex. Une équipe de sécurité essayant des dizaines de prompts de jailbreak avant le lancement.RLHF (Reinforcement Learning from Human Feedback)
Une technique d'entraînement qui utilise les jugements de préférence humains pour récompenser un modèle produisant des résultats jugés meilleurs par les évaluateurs, afin de l'aligner sur l'intention humaine.
ex. Des évaluateurs classent deux réponses du modèle ; le modèle est entraîné à préférer celle la mieux classée.