================================================================ AI FLUENCY — FICHE DE RÉVISION Mécanismes des LLM ================================================================ Fonctionnement des LLM : échantillonnage, fenêtre de contexte, embeddings, cache KV, quantification. 6 termes ---------------------------------------------------------------- * Context Window Le nombre maximal de tokens (entrée plus sortie) qu'un modèle peut prendre en compte à un instant donné. ex. Une fenêtre de contexte de 200K tokens peut contenir environ un livre de 500 pages. * Embedding Un vecteur numérique dense représentant le sens d'un texte, utilisé pour la recherche et les comparaisons de similarité. ex. « chien » et « chiot » ont des embeddings proches l'un de l'autre. * KV Cache Les tenseurs clé/valeur d'attention mis en cache à partir des tokens précédents, ce qui permet à un modèle d'éviter de les recalculer pour chaque nouveau token, accélérant ainsi la génération. ex. Les longues conversations réutilisent le cache au lieu de retraiter tout l'historique précédent. * Logits Les scores bruts et non normalisés qu'un modèle produit pour chaque token suivant possible, avant leur conversion en probabilités. ex. Une fonction softmax transforme les logits en une distribution de probabilité. * Quantization La réduction de la précision numérique des poids d'un modèle (par ex. de 16 bits à 4 bits) afin de réduire l'utilisation de la mémoire et d'accélérer l'inférence, au prix d'une certaine perte de précision. ex. Faire fonctionner un grand modèle sur un GPU d'ordinateur portable grâce à une quantification en 4 bits. * Sampling / Temperature Des paramètres utilisés pour choisir le prochain token dans la distribution de probabilité du modèle ; la température ajuste le degré d'aléatoire de ce choix. ex. Une température de 0 donne des réponses déterministes et reproductibles. ---------------------------------------------------------------- Astuce : collez ce fichier dans votre assistant IA préféré et demandez un tutorat.