OCRFlux Bench Single
Un benchmark multilingue de 2 000 pages PDF avec annotation Markdown pour tester les capacités de parsing de documents par OCR.
Description
OCRFlux Bench Single est un benchmark de haute qualité conçu pour évaluer les performances des systèmes OCR à parser des pages PDF. Il comprend 2 000 pages issues de documents internes, annotées manuellement en Markdown, en anglais et chinois. L’objectif est de tester la fidélité des systèmes OCR dans la conversion de pages PDF vers des formats structurés.
À quoi sert ce dataset ?
- Évaluer la précision des OCR sur des documents complexes (titres, tableaux, texte structuré)
- Tester des modèles OCR multilingues sur des contenus en anglais et chinois
- Améliorer la génération Markdown à partir de contenu visuel (PDF, scan)
Peut-on l’enrichir ou l’améliorer ?
Oui, le dataset peut être étendu à d’autres langues ou types de documents (ex. formulaires, documents juridiques). Des niveaux de titres, des distinctions de sections, ou une annotation fine des tableaux (thead, tbody) pourraient aussi enrichir la structure.
🔎 En résumé
🧠 Recommandé pour
- Développeurs OCR
- Chercheurs en extraction de texte
- Projets PDF-to-HTML
🔧 Outils compatibles
- Tesseract
- LayoutLMv3
- PaddleOCR
- PyMuPDF
- Markdown-it
💡 Astuce
Utilisez la version HTML des tableaux pour éviter les pertes d'information dans les structures complexes.
Questions fréquemment posées
Ce dataset peut-il être utilisé pour entraîner un modèle OCR ?
Il est plutôt conçu pour l’évaluation, mais peut servir de base pour fine-tuning sur du Markdown structuré.
Quel format est utilisé pour les annotations de tableau ?
Les tableaux sont représentés en HTML dans le Markdown afin de gérer les cellules fusionnées (rowspan, colspan).
Le dataset contient-il des documents dans d'autres langues que l'anglais et le chinois ?
Non, la version actuelle est limitée à l’anglais et au chinois. Toutefois, il est envisageable de l’étendre à d’autres langues avec des documents annotés selon la même structure.




