Aller au contenu
← Retour aux publicationsRécupération d'information

Réordonnancement par encodeur croisé

Nogueira & Cho, « Passage Re-ranking with BERT », 2019 · arXiv:1901.04085

La récupération dense doit encoder chaque passage indépendamment de la requête pour permettre l'indexation hors ligne. Cette contrainte a un coût de précision : la représentation d'un passage est calculée sans connaître la question, donc sans pouvoir mettre en avant l'aspect du passage qui la concerne. Le classement obtenu a un bon rappel, la bonne réponse figurant presque toujours dans les cent premiers résultats, mais une précision médiocre en tête de liste.

Nogueira et Cho établissent en 2019 l'efficacité d'une architecture en deux étages. Un encodeur croisé traite la concaténation de la requête et du passage en une seule passe, ce qui autorise l'attention à opérer entre les termes de l'un et de l'autre et produit un score de pertinence nettement plus fiable. Ce calcul étant quadratique et non indexable, il est inapplicable au corpus entier ; appliqué aux quelques dizaines de candidats remontés par le premier étage, son coût devient acceptable. Les auteurs rapportent des gains substantiels sur MS MARCO.

DeepView applique un réordonnancement de ce type aux candidats issus de la fusion des classements, et ne transmet au générateur que les mieux classés. La motivation est double : la précision du contexte conditionne directement la qualité de la génération, et un contexte court et dense diminue la probabilité que le modèle s'appuie sur un passage hors sujet.

Entrer dans le détail

Les choix d'architecture, les écarts assumés par rapport à la littérature et les résultats intermédiaires de l'évaluation se discutent directement avec l'équipe qui construit le système.