Pondération lexicale et termes rares
Robertson & Zaragoza, « The Probabilistic Relevance Framework: BM25 and Beyond », Foundations and Trends in Information Retrieval, 2009
La récupération dense apparie des textes sur leur proximité sémantique, ce qui la rend robuste aux variations de formulation mais mal adaptée aux termes à faible fréquence et forte spécificité : référence normative, numéro de lot, identifiant contractuel. Projetés dans un espace continu de dimension réduite, ces termes se retrouvent voisins de chaînes graphiquement proches mais sans rapport. Or ce sont précisément les requêtes où une correspondance approchée n'a aucune valeur.
BM25 formalise la pertinence lexicale dans le cadre probabiliste synthétisé par Robertson et Zaragoza. La fonction de score combine trois composantes : la fréquence du terme dans le document, saturée par un paramètre qui borne le gain des occurrences répétées ; la fréquence documentaire inverse, qui pondère un terme par sa rareté dans le corpus ; et une normalisation par la longueur du document, qui corrige le biais des modèles antérieurs en faveur des documents longs. Aucun paramètre n'est appris sur données annotées : le score est déterministe et inspectable.
DeepView exécute BM25 en parallèle de la récupération dense, non en substitution. Une précision sur ce que cela apporte, et sur ce que cela n'apporte pas : les documents sont découpés en termes, sans notion d'ordre ni de casse, si bien qu'une référence comme « PRO-042 » compte comme deux termes distincts plutôt que comme une chaîne. Ce n'est donc pas une recherche exacte au sens strict. Ce que la fréquence documentaire inverse garantit, en revanche, c'est qu'un terme rare pèse beaucoup plus qu'un mot courant : un document portant la bonne référence remonte, là où la seule proximité sémantique ramènerait des documents voisins sur le fond mais portant une autre référence. Les deux classements sont ensuite fusionnés, selon la méthode décrite dans la notice sur la fusion par rang réciproque.
Entrer dans le détail
Les choix d'architecture, les écarts assumés par rapport à la littérature et les résultats intermédiaires de l'évaluation se discutent directement avec l'équipe qui construit le système.