olmOCR PES2O Dataset
Corpus OCR massif issu de documents numérisés, utilisé pour la reconnaissance optique de caractères et la modélisation de texte extrait.
7,8 millions de lignes, fichiers texte + métadonnées structurées
ODC-BY
Description
olmOCR-pes2o-0225 est un dataset open-source massif conçu pour les tâches de reconnaissance optique de caractères (OCR). Il contient des millions d’exemples tirés de documents numérisés, chaque ligne représentant une instance OCR avec son texte extrait et des métadonnées associées. Il est conçu pour servir à la fois à l’entraînement, à l’évaluation et à l’analyse de performance des systèmes OCR modernes.
À quoi sert ce dataset ?
- Entraîner des modèles OCR capables d’extraire du texte de documents réels
- Tester la robustesse des modèles sur un large éventail de typologies de documents
- Construire des pipelines de traitement documentaire à base d’IA
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible d’ajouter des annotations structurelles (zones de texte, hiérarchie), ou de coupler ce corpus avec les images originales pour des modèles visio-textuels. L’ajout de langues ou formats variés (ex. manuscrits) est aussi envisageable.
🔎 En résumé
🧠 Recommandé pour
- Ingénieurs data OCR
- Développeurs de moteurs de lecture automatique de documents
- Projets d’archivage numérique
🔧 Outils compatibles
- PyTesseract
- Hugging Face Transformers
- Donut
- TrOCR
- LayoutLM
💡 Astuce
Filtrer les exemples avec faible confiance OCR pour améliorer la qualité des jeux d’entraînement.
Questions fréquemment posées
Ce dataset inclut-il les images originales des documents ?
Non, il contient uniquement le texte extrait et les métadonnées associées. L’image source n’est pas fournie.
Peut-on l’utiliser pour entraîner un modèle OCR complet ?
Oui, mais il faudra le coupler à des images similaires pour la phase visuelle. Le dataset reste utile pour le prétraitement texte.
Le contenu couvre-t-il plusieurs langues ou uniquement l’anglais ?
Le dataset est principalement anglophone. Il peut cependant être enrichi pour des applications multilingues.




