Représenter le sens dans un espace vectoriel
Reimers & Gurevych, « Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks », EMNLP 2019 · arXiv:1908.10084
L'appariement lexical opère sur les formes de surface. Deux passages décrivant le même concept avec des vocabulaires disjoints (un rapport d'incident mentionnant un « arrêt d'urgence », une procédure décrivant une « mise en sécurité de l'installation ») obtiennent un score de recouvrement nul. Ce décalage de vocabulaire (vocabulary mismatch) est un problème identifié de longue date en recherche d'information, et il s'aggrave sur les corpus rédigés par des auteurs multiples sur des périodes longues.
Reimers et Gurevych proposent en 2019 une architecture siamoise qui produit des représentations vectorielles de phrases comparables entre elles. BERT, dans sa formulation d'origine, doit encoder conjointement les deux textes pour les comparer, ce qui rend le coût quadratique en nombre de passages et interdit toute indexation préalable. En entraînant deux encodeurs à poids partagés sur un objectif contrastif, les auteurs obtiennent des représentations indépendantes, calculables hors ligne pour l'ensemble du corpus, et comparables par produit scalaire ou similarité cosinus. La comparaison devient une recherche de plus proches voisins, sous-linéaire avec un index approché.
DeepView indexe le corpus avec un modèle de cette famille, dans une variante multilingue qui projette les différentes langues dans un espace commun : une requête en français apparie un passage en anglais sans traduction intermédiaire. Ces modèles sont sous licence ouverte et s'exécutent sur votre matériel ; l'indexation comme l'inférence restent dans votre environnement, sans appel à un service tiers.
Entrer dans le détail
Les choix d'architecture, les écarts assumés par rapport à la littérature et les résultats intermédiaires de l'évaluation se discutent directement avec l'équipe qui construit le système.