Guide / Fiches

Mécanismes des LLM

Fonctionnement des LLM : échantillonnage, fenêtre de contexte, embeddings, cache KV, quantification.

↓ Télécharger cette fiche (.txt)

Context Window

Le nombre maximal de tokens (entrée plus sortie) qu'un modèle peut prendre en compte à un instant donné.

ex. Une fenêtre de contexte de 200K tokens peut contenir environ un livre de 500 pages.

Embedding

Un vecteur numérique dense représentant le sens d'un texte, utilisé pour la recherche et les comparaisons de similarité.

ex. « chien » et « chiot » ont des embeddings proches l'un de l'autre.

KV Cache

Les tenseurs clé/valeur d'attention mis en cache à partir des tokens précédents, ce qui permet à un modèle d'éviter de les recalculer pour chaque nouveau token, accélérant ainsi la génération.

ex. Les longues conversations réutilisent le cache au lieu de retraiter tout l'historique précédent.

Logits

Les scores bruts et non normalisés qu'un modèle produit pour chaque token suivant possible, avant leur conversion en probabilités.

ex. Une fonction softmax transforme les logits en une distribution de probabilité.

Quantization

La réduction de la précision numérique des poids d'un modèle (par ex. de 16 bits à 4 bits) afin de réduire l'utilisation de la mémoire et d'accélérer l'inférence, au prix d'une certaine perte de précision.

ex. Faire fonctionner un grand modèle sur un GPU d'ordinateur portable grâce à une quantification en 4 bits.

Sampling / Temperature

Des paramètres utilisés pour choisir le prochain token dans la distribution de probabilité du modèle ; la température ajuste le degré d'aléatoire de ce choix.

ex. Une température de 0 donne des réponses déterministes et reproductibles.