Guide / Fiches

IA multimodale

Vision, parole, génération d'images, embeddings intermodaux et architectures multimodales.

↓ Télécharger cette fiche (.txt)

Automatic Speech Recognition (ASR)

Une compétence de modèle qui convertit un audio parlé en transcription textuelle.

ex. Whisper transcrivant en texte l'enregistrement d'une réunion.

CLIP (Contrastive Language–Image Pre-training)

Un modèle entraîné à aligner les embeddings de texte et d'image dans un espace vectoriel partagé, permettant la classification d'images en zero-shot et le guidage de la génération d'images.

ex. Faire correspondre la légende « un chien sur une plage » à la bonne photo parmi des milliers.

Diffusion Model

Un modèle génératif qui produit des images (ou d'autres données) en éliminant itérativement du bruit à partir d'un point de départ aléatoire, guidé par un signal de conditionnement comme un prompt textuel.

ex. Stable Diffusion transformant un prompt textuel en une image photoréaliste.

Multimodal Model

Un modèle d'IA capable de traiter et/ou de générer plus d'un type de données, comme du texte, des images, de l'audio ou de la vidéo.

ex. GPT-4o peut accepter du texte, des images et de l'audio, et produire du texte ou de l'audio.

Vision Transformer (ViT)

Une architecture transformer qui traite une image comme une séquence de patches et applique de l'auto-attention, au lieu d'utiliser des convolutions.

ex. Découper une photo en une grille de petits patches avant de la transmettre au modèle.

Vision-Language Model (VLM)

Un modèle qui relie des représentations visuelles et linguistiques pour accomplir des tâches comme le sous-titrage d'images ou la réponse à des questions visuelles.

ex. Décrire en une phrase complète ce qui se passe sur une photo.