================================================================ AI FLUENCY — FICHE DE RÉVISION IA multimodale ================================================================ Vision, parole, génération d'images, embeddings intermodaux et architectures multimodales. 6 termes ---------------------------------------------------------------- * Automatic Speech Recognition (ASR) Une compétence de modèle qui convertit un audio parlé en transcription textuelle. ex. Whisper transcrivant en texte l'enregistrement d'une réunion. * CLIP (Contrastive Language–Image Pre-training) Un modèle entraîné à aligner les embeddings de texte et d'image dans un espace vectoriel partagé, permettant la classification d'images en zero-shot et le guidage de la génération d'images. ex. Faire correspondre la légende « un chien sur une plage » à la bonne photo parmi des milliers. * Diffusion Model Un modèle génératif qui produit des images (ou d'autres données) en éliminant itérativement du bruit à partir d'un point de départ aléatoire, guidé par un signal de conditionnement comme un prompt textuel. ex. Stable Diffusion transformant un prompt textuel en une image photoréaliste. * Multimodal Model Un modèle d'IA capable de traiter et/ou de générer plus d'un type de données, comme du texte, des images, de l'audio ou de la vidéo. ex. GPT-4o peut accepter du texte, des images et de l'audio, et produire du texte ou de l'audio. * Vision Transformer (ViT) Une architecture transformer qui traite une image comme une séquence de patches et applique de l'auto-attention, au lieu d'utiliser des convolutions. ex. Découper une photo en une grille de petits patches avant de la transmettre au modèle. * Vision-Language Model (VLM) Un modèle qui relie des représentations visuelles et linguistiques pour accomplir des tâches comme le sous-titrage d'images ou la réponse à des questions visuelles. ex. Décrire en une phrase complète ce qui se passe sur une photo. ---------------------------------------------------------------- Astuce : collez ce fichier dans votre assistant IA préféré et demandez un tutorat.