Reconstruire la structure logique d'un PDF
Auer et al., « Docling Technical Report », IBM Research, 2024 · arXiv:2408.09869
PDF est un format de présentation : il spécifie des glyphes et leurs coordonnées sur une page, sans encoder de structure logique. Rien n'y distingue un titre d'un corps de texte, ni ne délimite un tableau, ni n'établit l'ordre de lecture. Une extraction naïve concatène les glyphes dans l'ordre du flux, ce qui entrelace les colonnes d'une mise en page multi-colonnes, linéarise un tableau en une séquence de cellules privée de ses en-têtes, et perd la hiérarchie des sections. La dégradation est silencieuse : le texte extrait reste lisible tout en ayant perdu la relation qui portait le sens.
L'équipe d'IBM Research décrit en 2024 avec Docling une chaîne de traitement qui traite l'analyse de mise en page comme un problème de vision. Un modèle de détection d'objets segmente la page en régions typées (titre, paragraphe, tableau, figure, en-tête) dont l'ordre de lecture est ensuite reconstruit ; un second modèle, spécialisé, reconstitue la structure des tableaux, y compris les cellules fusionnées et les en-têtes hiérarchiques. Un moteur de reconnaissance optique prend le relais sur les pages sans couche de texte. La sortie est une représentation structurée, et non un flux de caractères.
C'est la première étape de l'indexation dans DeepView, et elle conditionne tout ce qui suit : une relation ligne-colonne perdue à ce stade est irrécupérable, quelle que soit la qualité des étapes ultérieures. Le découpage en passages s'appuie sur cette structure plutôt que sur une longueur fixe, ce qui évite de scinder un tableau ou de séparer un titre de la section qu'il introduit. L'ensemble s'exécute sur votre matériel, documents numérisés compris, sans accès réseau sortant.
Entrer dans le détail
Les choix d'architecture, les écarts assumés par rapport à la littérature et les résultats intermédiaires de l'évaluation se discutent directement avec l'équipe qui construit le système.