Aller au contenu

Recherche

Les travaux sur lesquels
DeepView est construit.

DeepView est un système de génération augmentée par récupération (Retrieval-Augmented Generation). Chacun de ses composants implémente une méthode publiée et évaluée par la communauté scientifique : recherche lexicale et dense, fusion de classements, réordonnancement, extraction de graphes de connaissances, vérification de l'ancrage des réponses.

Nous ne retenons que des travaux issus des meilleures conférences et équipes du domaine, et qui tiennent une fois confrontés à des documents réels. Chaque publication a sa notice : le problème qu'elle formalise, la méthode qu'elle propose, et ce que notre implémentation en retient, y compris les écarts que nous assumons par rapport au travail d'origine.

Analyse documentaire

Cui et al., « RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild », 2026 · arXiv:2606.23344

Un document d'entreprise est rarement une page propre : il est scanné de travers, photographié, plié. Les chaînes en plusieurs modèles y accumulent les erreurs d'une étape à l'autre.

Dans DeepView : l'analyse de mise en page sur documents dégradés

Lire l'article →

Śmigielski et al., « Chunking Methods on Retrieval-Augmented Generation: Effectiveness Evaluation Against Computational Cost and Limitations », Wrocław University of Science and Technology, 2026 · arXiv:2606.00881

Découper les documents en passages passe pour un réglage technique sans conséquence. C'est en réalité l'un des choix qui pèsent le plus sur ce qu'un système saura retrouver.

Dans DeepView : le choix de la stratégie de découpage

Lire l'article →

Auer et al., « Docling Technical Report », IBM Research, 2024 · arXiv:2408.09869

Le format PDF encode un rendu, pas une structure : des glyphes positionnés en coordonnées. L'ordre de lecture, les colonnes et les tableaux doivent être reconstruits par inférence.

Dans DeepView : l'analyse de la mise en page à l'indexation

Lire l'article →

Récupération d'information

Lewis et al., « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks », NeurIPS 2020 · arXiv:2005.11401

Les connaissances d'un modèle de langage sont figées dans ses paramètres à la date de son entraînement. Interrogé hors de cette distribution, il génère une réponse plausible plutôt qu'un refus.

Dans DeepView : l'architecture générale du système

Lire l'article →

Robertson & Zaragoza, « The Probabilistic Relevance Framework: BM25 and Beyond », Foundations and Trends in Information Retrieval, 2009

Les représentations denses projettent les termes rares dans un espace continu, où un identifiant perd la spécificité qui le rendait discriminant. La pondération lexicale reste nécessaire.

Dans DeepView : la composante lexicale de la récupération

Lire l'article →

Reimers & Gurevych, « Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks », EMNLP 2019 · arXiv:1908.10084

L'appariement lexical échoue dès que deux formulations d'un même concept ne partagent aucun terme. Le problème est celui du décalage de vocabulaire entre requête et document.

Dans DeepView : la composante dense de la récupération

Lire l'article →

Réordonnancement par encodeur croisé

Fiabilité et vérification

Nogueira & Cho, « Passage Re-ranking with BERT », 2019 · arXiv:1901.04085

Les encodeurs indépendants sont indexables mais imprécis : la requête et le passage sont vectorisés séparément, sans interaction entre leurs termes.

Dans DeepView : le réordonnancement des candidats

Lire l'article →

Cormack, Clarke & Büttcher, « Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods », SIGIR 2009

Un score BM25 et une similarité cosinus n'ont ni la même échelle ni la même distribution. Les combiner linéairement suppose une normalisation que rien ne justifie.

Dans DeepView : la fusion des classements

Lire l'article →

Graphe de connaissances

Edge et al., « From Local to Global: A Graph RAG Approach to Query-Focused Summarization », Microsoft Research, 2024 · arXiv:2404.16130

La récupération par passages traite chaque unité indépendamment. Une requête dont la réponse est distribuée sur des dizaines de documents excède ce que ce paradigme peut construire.

Dans DeepView : l'extraction et le parcours du graphe

Lire l'article →

Fiabilité et vérification

Yan et al., « Corrective Retrieval Augmented Generation », 2024 · arXiv:2401.15884

La qualité de la génération est bornée par celle de la récupération. Un système qui génère inconditionnellement propage les échecs de récupération en réponses fluides et fausses.

Dans DeepView : l'évaluation des candidats avant génération

Lire l'article →

Attribution et choix des travaux

Ces travaux sont l'œuvre de leurs auteurs et n'ont aucun lien avec Alister AI : nous n'en revendiquons ni la paternité ni le soutien, et aucun de ces auteurs n'a participé à DeepView. Nous retenons une publication sur deux critères : la solidité de son évaluation, et sa tenue sur des documents réels plutôt que sur les seuls jeux de référence académiques. Un gain qui ne survit pas au passage sur une documentation d'entreprise ne nous intéresse pas, quel que soit le prestige de la conférence. C'est aussi pourquoi nous nous écartons parfois de la méthode d'origine quand nos contraintes de déploiement appellent d'autres choix : ces écarts sont signalés dans les notices concernées.

Évaluation

Protocole d'évaluation interne

Nous évaluons l'apport du graphe de connaissances par rapport à une architecture RAG purement vectorielle, sur un jeu de questions stratifié par complexité. Le protocole est décrit ci-dessous ; la campagne est en cours.

  • Système de référenceune architecture RAG vectorielle standard (AnythingLLM), à corpus et modèle de génération identiques.
  • Système évaluéDeepView : récupération hybride (BM25, dense, graphe) suivie d'un réordonnancement.
  • Jeu de questionsenviron 100 questions sur corpus documentaire d'entreprise, stratifiées en 5 niveaux de complexité, avec réponses de référence établies manuellement.
  • Métriquesexactitude et complétude de la réponse, taux d'ancrage dans les sources citées, taux d'hallucination, résolution des questions multi-sauts, latence et coût par requête.

Stratification des questions

  1. Niveau 1 — Extraction directe

    la réponse figure littéralement dans un passage unique.

  2. Niveau 2 — Appariement sémantique

    la question et le passage pertinent ne partagent pas de vocabulaire.

  3. Niveau 3 — Agrégation

    la réponse impose de combiner plusieurs passages ou documents.

  4. Niveau 4 — Multi-sauts

    la réponse impose de suivre une chaîne de relations entre entités.

  5. Niveau 5 — Questions discriminantes

    questions construites pour que la similarité vectorielle seule soit insuffisante.

Statut

La campagne d'évaluation est en cours. Nous publierons ici l'étude complète : protocole détaillé, jeu de questions, résultats chiffrés par niveau et par métrique. En attendant, le graphique ci-contre représente notre hypothèse de travail, et non des mesures.

Entrer dans le détail

Les choix d'architecture, les écarts assumés par rapport à la littérature et les résultats intermédiaires de l'évaluation se discutent directement avec l'équipe qui construit le système.