Chunking
Diviser de longs documents en passages plus courts avant de les indexer et de les vectoriser, car la recherche fonctionne sur des unités de la taille d'un fragment.
ex. Diviser un PDF de 50 pages en fragments de 500 tokens.Génération augmentée par la recherche, recherche vectorielle, découpage en chunks, reranking.
Diviser de longs documents en passages plus courts avant de les indexer et de les vectoriser, car la recherche fonctionne sur des unités de la taille d'un fragment.
ex. Diviser un PDF de 50 pages en fragments de 500 tokens.Ancrer la réponse d'un modèle dans du matériel source récupéré ou fourni afin qu'il soit moins susceptible d'halluciner.
ex. Exiger que le modèle cite le passage source exact qu'il a utilisé.Une seconde passe de notation plus précise sur un ensemble initial de candidats récupérés, afin de les réordonner selon leur pertinence réelle avant qu'ils n'atteignent le modèle.
ex. Un reranker à cross-encoder réévalue les 50 meilleurs résultats de la recherche vectorielle.Récupérer des documents externes pertinents au moment de la requête et les injecter dans le contexte du modèle afin qu'il puisse répondre avec des informations à jour ou privées.
ex. Chercher dans le wiki d'une entreprise avant de répondre à une question interne.Un entrepôt de données optimisé pour stocker des embeddings et exécuter des recherches de similarité par plus proches voisins à grande échelle.
ex. Pinecone, Weaviate et pgvector sont tous des bases de données vectorielles.Trouver les documents les plus pertinents en comparant la similarité des embeddings plutôt que par correspondance exacte de mots-clés.
ex. Une requête sur « problème de voiture » correspond aussi à un document sur « panne de véhicule ».