En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
olmOCR PES2O Dataset
Image

olmOCR PES2O Dataset

Corpus OCR massif issu de documents numérisés, utilisé pour la reconnaissance optique de caractères et la modélisation de texte extrait.

Télécharger le dataset
Taille

7,8 millions de lignes, fichiers texte + métadonnées structurées

Licence

ODC-BY

Description

‍

olmOCR-pes2o-0225 est un dataset open-source massif conçu pour les tâches de reconnaissance optique de caractères (OCR). Il contient des millions d’exemples tirés de documents numérisés, chaque ligne représentant une instance OCR avec son texte extrait et des métadonnées associées. Il est conçu pour servir à la fois à l’entraînement, à l’évaluation et à l’analyse de performance des systèmes OCR modernes.

‍

‍

À quoi sert ce dataset ?

‍

  • Entraîner des modèles OCR capables d’extraire du texte de documents réels
  • Tester la robustesse des modèles sur un large éventail de typologies de documents
  • Construire des pipelines de traitement documentaire à base d’IA

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui. Il est possible d’ajouter des annotations structurelles (zones de texte, hiérarchie), ou de coupler ce corpus avec les images originales pour des modèles visio-textuels. L’ajout de langues ou formats variés (ex. manuscrits) est aussi envisageable.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Simple à parser, fichiers bien structurés)
🧼 Besoin de nettoyage⭐⭐⭐⭐✩ (Faible – les données sont cohérentes mais peuvent nécessiter une validation OCR)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Moyenne – texte brut + quelques métadonnées, pas de segmentation visuelle)
📜 Licence commerciale✅ Oui (ODC-BY)
👨‍💻 Idéal pour les débutants⚠️ Oui, si outils d’OCR déjà maîtrisés
🔁 Réutilisable en fine-tuning🎯 Parfait pour affiner des modèles OCR type Tesseract, Donut, TrOCR
🌍 Diversité culturelle⚠️ Non spécifié – contenu principalement anglophone

‍

‍

🧠 Recommandé pour

  • Ingénieurs data OCR
  • Développeurs de moteurs de lecture automatique de documents
  • Projets d’archivage numérique

‍

‍

🔧 Outils compatibles

  • PyTesseract
  • Hugging Face Transformers
  • Donut
  • TrOCR
  • LayoutLM

‍

‍

💡 Astuce

Filtrer les exemples avec faible confiance OCR pour améliorer la qualité des jeux d’entraînement.

Questions fréquemment posées

Ce dataset inclut-il les images originales des documents ?

Non, il contient uniquement le texte extrait et les métadonnées associées. L’image source n’est pas fournie.

Peut-on l’utiliser pour entraîner un modèle OCR complet ?

Oui, mais il faudra le coupler à des images similaires pour la phase visuelle. Le dataset reste utile pour le prétraitement texte.

Le contenu couvre-t-il plusieurs langues ou uniquement l’anglais ?

Le dataset est principalement anglophone. Il peut cependant être enrichi pour des applications multilingues.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.