Aller au contenu
← Retour aux publicationsFiabilité et vérification

Évaluer la récupération avant de générer

Yan et al., « Corrective Retrieval Augmented Generation », 2024 · arXiv:2401.15884

Dans une architecture RAG standard, la génération est déclenchée quels que soient les passages remontés. La qualité de la réponse est donc bornée par celle de la récupération, et un échec en amont ne produit pas un échec visible en aval : le générateur, contraint de répondre à partir d'un contexte hors sujet, produit une réponse également hors sujet mais formulée avec la même assurance. L'erreur est d'autant plus coûteuse qu'elle est indétectable pour l'utilisateur.

Yan et ses coauteurs introduisent en 2024 un évaluateur léger appliqué aux passages récupérés avant toute génération, qui classe la récupération en trois régimes : correcte, incorrecte, ou ambiguë. À chaque régime correspond une action distincte : utiliser les passages après filtrage fin, déclencher une récupération alternative, ou combiner les deux. Le mécanisme est correctif au sens strict : il agit sur l'entrée du générateur plutôt que sur sa sortie, et son coût reste faible puisque l'évaluateur est nettement plus léger que le générateur.

DeepView évalue de cette manière les passages retenus avant de rédiger, et relance la recherche lorsqu'il en reste trop peu pour répondre : la question est réécrite sous un autre angle, avec un vocabulaire élargi. Notre critère est plus fruste que celui de l'article, qui classe la récupération en trois régimes à partir d'un score : nous comptons les passages qui survivent au filtrage et les comparons à un minimum. Le nombre de reprises est borné, ce qui garantit la terminaison. Si aucune passe ne ramène de quoi répondre, le système le dit explicitement au lieu de rédiger sur des passages qu'il a lui-même jugés insuffisants. Second écart avec le travail d'origine : les auteurs prévoient un repli sur une recherche web, que nous n'implémentons pas, le corpus devant rester le seul périmètre de réponse.

Entrer dans le détail

Les choix d'architecture, les écarts assumés par rapport à la littérature et les résultats intermédiaires de l'évaluation se discutent directement avec l'équipe qui construit le système.