Aller au contenu
← Retour aux publicationsRécupération d'information

Fusionner des classements aux scores incomparables

Cormack, Clarke & Büttcher, « Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods », SIGIR 2009

Combiner plusieurs systèmes de récupération suppose de rendre leurs scores comparables. Un score BM25 est non borné et dépend du corpus ; une similarité cosinus est bornée mais concentrée sur une plage étroite dont la distribution varie selon le modèle. Toute combinaison linéaire impose donc une normalisation préalable et une pondération, l'une et l'autre à estimer sur des données annotées, qui n'existent généralement pas pour un corpus client et devraient être réestimées à chaque déploiement.

Cormack, Clarke et Büttcher proposent en 2009 de contourner le problème en écartant les scores : la fusion par rang réciproque n'utilise que le rang de chaque document dans chaque classement, et somme les inverses de ces rangs décalés d'une constante. Un document bien classé par plusieurs systèmes obtient un score de fusion élevé même sans être premier chez aucun ; un document isolé en tête d'un seul système pèse moins. Les auteurs montrent que cette règle, sans aucun paramètre appris, dépasse des méthodes d'apprentissage de classement supervisées ainsi que la fusion de Condorcet.

DeepView fusionne par cette méthode les classements lexical, dense et issu du graphe. Notre implémentation ajoute une pondération par source à la formule d'origine : chaque contribution est multipliée par un poids propre au moteur dont elle vient, ce qui permet d'accorder plus d'importance au lexical sur une base très normative que sur un ensemble de comptes rendus rédigés en langage libre. Ces poids et la constante de décalage sont des réglages de déploiement, communs à l'instance, et non des valeurs déduites automatiquement de chaque corpus. La contribution du graphe suppose par ailleurs que celui-ci soit provisionné : à défaut, la fusion porte sur les deux autres classements.

Entrer dans le détail

Les choix d'architecture, les écarts assumés par rapport à la littérature et les résultats intermédiaires de l'évaluation se discutent directement avec l'équipe qui construit le système.