Context Window
Le nombre maximal de tokens (entrée plus sortie) qu'un modèle peut prendre en compte à un instant donné.
ex. Une fenêtre de contexte de 200K tokens peut contenir environ un livre de 500 pages.Fonctionnement des LLM : échantillonnage, fenêtre de contexte, embeddings, cache KV, quantification.
Le nombre maximal de tokens (entrée plus sortie) qu'un modèle peut prendre en compte à un instant donné.
ex. Une fenêtre de contexte de 200K tokens peut contenir environ un livre de 500 pages.Un vecteur numérique dense représentant le sens d'un texte, utilisé pour la recherche et les comparaisons de similarité.
ex. « chien » et « chiot » ont des embeddings proches l'un de l'autre.Les tenseurs clé/valeur d'attention mis en cache à partir des tokens précédents, ce qui permet à un modèle d'éviter de les recalculer pour chaque nouveau token, accélérant ainsi la génération.
ex. Les longues conversations réutilisent le cache au lieu de retraiter tout l'historique précédent.Les scores bruts et non normalisés qu'un modèle produit pour chaque token suivant possible, avant leur conversion en probabilités.
ex. Une fonction softmax transforme les logits en une distribution de probabilité.La réduction de la précision numérique des poids d'un modèle (par ex. de 16 bits à 4 bits) afin de réduire l'utilisation de la mémoire et d'accélérer l'inférence, au prix d'une certaine perte de précision.
ex. Faire fonctionner un grand modèle sur un GPU d'ordinateur portable grâce à une quantification en 4 bits.Des paramètres utilisés pour choisir le prochain token dans la distribution de probabilité du modèle ; la température ajuste le degré d'aléatoire de ce choix.
ex. Une température de 0 donne des réponses déterministes et reproductibles.