En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
OCRFlux Bench Single
Texte

OCRFlux Bench Single

Un benchmark multilingue de 2 000 pages PDF avec annotation Markdown pour tester les capacités de parsing de documents par OCR.

Télécharger le dataset
Taille

2 000 pages annotées (Markdown), bilingue EN/ZH

Licence

Apache 2.0

Description

‍

OCRFlux Bench Single est un benchmark de haute qualité conçu pour évaluer les performances des systèmes OCR à parser des pages PDF. Il comprend 2 000 pages issues de documents internes, annotées manuellement en Markdown, en anglais et chinois. L’objectif est de tester la fidélité des systèmes OCR dans la conversion de pages PDF vers des formats structurés.

‍

‍

À quoi sert ce dataset ?

‍

  • Évaluer la précision des OCR sur des documents complexes (titres, tableaux, texte structuré)
  • Tester des modèles OCR multilingues sur des contenus en anglais et chinois
  • Améliorer la génération Markdown à partir de contenu visuel (PDF, scan)

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, le dataset peut être étendu à d’autres langues ou types de documents (ex. formulaires, documents juridiques). Des niveaux de titres, des distinctions de sections, ou une annotation fine des tableaux (thead, tbody) pourraient aussi enrichir la structure.

‍

‍

🔎 En résumé

Critère Évaluation
🧩Facilité d’utilisation ⭐⭐⭐⭐⭐ (structure par page, format clair)
🧼Besoin de nettoyage ⭐⭐⭐⭐⭐ (données validées manuellement)
🏷️Richesse des annotations ⭐⭐⭐⭐☆ (structure Markdown précise, incluant tableaux HTML)
📜Licence commerciale ✅ Oui (Apache 2.0)
👨‍💻Idéal pour les débutants 👨‍💻 Oui – idéal pour tests OCR/Markdown
🔁Réutilisable en fine-tuning 📐 Plus utile comme benchmark que pour entraînement massif
🌍Diversité culturelle 🌏 Bilingue : anglais et chinois

‍

‍

🧠 Recommandé pour

  • Développeurs OCR
  • Chercheurs en extraction de texte
  • Projets PDF-to-HTML

‍

‍

🔧 Outils compatibles

  • Tesseract
  • LayoutLMv3
  • PaddleOCR
  • PyMuPDF
  • Markdown-it

‍

‍

💡 Astuce

Utilisez la version HTML des tableaux pour éviter les pertes d'information dans les structures complexes.

Questions fréquemment posées

Ce dataset peut-il être utilisé pour entraîner un modèle OCR ?

Il est plutôt conçu pour l’évaluation, mais peut servir de base pour fine-tuning sur du Markdown structuré.

Quel format est utilisé pour les annotations de tableau ?

Les tableaux sont représentés en HTML dans le Markdown afin de gérer les cellules fusionnées (rowspan, colspan).

Le dataset contient-il des documents dans d'autres langues que l'anglais et le chinois ?

Non, la version actuelle est limitée à l’anglais et au chinois. Toutefois, il est envisageable de l’étendre à d’autres langues avec des documents annotés selon la même structure.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.