Automatic Speech Recognition (ASR)
Une compétence de modèle qui convertit un audio parlé en transcription textuelle.
ex. Whisper transcrivant en texte l'enregistrement d'une réunion.Vision, parole, génération d'images, embeddings intermodaux et architectures multimodales.
Une compétence de modèle qui convertit un audio parlé en transcription textuelle.
ex. Whisper transcrivant en texte l'enregistrement d'une réunion.Un modèle entraîné à aligner les embeddings de texte et d'image dans un espace vectoriel partagé, permettant la classification d'images en zero-shot et le guidage de la génération d'images.
ex. Faire correspondre la légende « un chien sur une plage » à la bonne photo parmi des milliers.Un modèle génératif qui produit des images (ou d'autres données) en éliminant itérativement du bruit à partir d'un point de départ aléatoire, guidé par un signal de conditionnement comme un prompt textuel.
ex. Stable Diffusion transformant un prompt textuel en une image photoréaliste.Un modèle d'IA capable de traiter et/ou de générer plus d'un type de données, comme du texte, des images, de l'audio ou de la vidéo.
ex. GPT-4o peut accepter du texte, des images et de l'audio, et produire du texte ou de l'audio.Une architecture transformer qui traite une image comme une séquence de patches et applique de l'auto-attention, au lieu d'utiliser des convolutions.
ex. Découper une photo en une grille de petits patches avant de la transmettre au modèle.Un modèle qui relie des représentations visuelles et linguistiques pour accomplir des tâches comme le sous-titrage d'images ou la réponse à des questions visuelles.
ex. Décrire en une phrase complète ce qui se passe sur une photo.