Analyser une page et son ordre de lecture d'un seul tenant
Cui et al., « RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild », 2026 · arXiv:2606.23344
Les chaînes d'analyse documentaire enchaînent classiquement des modèles séparés : détection des régions, segmentation, puis reconstruction de l'ordre de lecture. Chaque étape hérite des erreurs de la précédente, sans pouvoir les corriger : une région mal découpée reste mal découpée, et l'ordre de lecture est calculé sur des blocs déjà faux. Le problème s'aggrave sur ce que la littérature appelle les documents « in the wild », c'est-à-dire les documents réels : pages numérisées de travers, papier gondolé, photographies prises en biais, mises en page composites. C'est exactement la matière que reçoit un système déployé en entreprise, où les archives comportent des documents scannés il y a quinze ans.
Cui et ses coauteurs proposent en 2026 une architecture qui unifie en un seul modèle la classification, la détection, la segmentation au niveau du pixel et la prédiction de l'ordre de lecture. Traiter conjointement ces quatre tâches supprime la propagation d'erreurs entre étapes : l'ordre de lecture est prédit à partir de la même représentation que la segmentation, et non plus recalculé après coup sur une sortie figée. Le modèle atteint l'état de l'art en analyse de mise en page avec 33 millions de paramètres seulement, à 132 images par seconde, alors que la tendance du domaine est aux grands modèles vision-langage bien plus lourds.
C'est ce compromis qui nous intéresse, plus que le classement sur les jeux de référence. Un modèle de 33 millions de paramètres tourne sur le matériel déjà présent chez nos clients, sans carte graphique dédiée à l'indexation, là où un grand modèle vision-langage imposerait soit un investissement matériel, soit un appel à un service extérieur, ce que notre principe de déploiement exclut. La vitesse compte tout autant : une reprise d'archives se chiffre en centaines de milliers de pages, et un facteur dix sur le débit d'indexation est la différence entre une nuit et deux semaines.
Entrer dans le détail
Les choix d'architecture, les écarts assumés par rapport à la littérature et les résultats intermédiaires de l'évaluation se discutent directement avec l'équipe qui construit le système.