
Le corpus de récupération (retrieval) est l'ensemble des documents qu'un système interroge au moment de la requête pour ancrer sa réponse, distinct des données sur lesquelles le modèle sous-jacent a été entraîné.
La récupération se fait en direct. Le corpus peut réunir du contenu web indexé, des bases sous licence, des documents chargés par l'utilisateur ou un ensemble curé, selon le système.
Corpus de récupération ou données d'entraînement ?
Les données d'entraînement sont historiques et figées à une date. Le corpus est interrogé dans l'instant — c'est pourquoi un document publié cette semaine peut façonner une réponse donnée aujourd'hui par un modèle entraîné il y a un an.
Pourquoi ça compte
C'est le mécanisme par lequel une recherche tierce, à jour et bien structurée pèse plus lourd qu'une décennie de marketing produit par le fournisseur lui-même.
Le volume publié ne procure ici presque aucun avantage. Ce qui compte, c'est qu'un document réponde à la question posée, assez clairement pour être extrait, depuis une source que le système juge crédible — soit à peu près la définition d'une recherche d'analystes.
À lire aussi : Grounding · Surface de citation · Moteur de réponse · Affirmation lisible par machine
Révélez dès aujourd'hui le potentiel de votre marketing produit!
Contactez-nous pour en savoir plus sur la manière dont nous pouvons vous aider à accélérer le succès de votre entreprise.


