olmOCR PES2O Dataset
Corpus masivo de OCR de documentos escaneados, utilizado para el reconocimiento óptico de caracteres y el modelado de texto extraído.
7,8 millones de líneas, archivos de texto y metadatos estructurados
DOC-POR
Descripción
OlmoCR-PES2O-0225 es un enorme conjunto de datos de código abierto diseñado para las tareas de reconocimiento óptico de caracteres (OCR). Contiene millones de ejemplos de documentos escaneados. Cada línea representa una instancia de OCR con el texto extraído y los metadatos asociados. Está diseñado para usarse al mismo tiempo en el entrenamiento, la evaluación y el análisis del rendimiento de los sistemas de OCR modernos.
¿Para qué sirve este conjunto de datos?
- Entrene modelos de OCR que puedan extraer texto de documentos reales
- Pruebe la solidez de los modelos en una amplia gama de tipos de documentos
- Creación de canales de procesamiento de documentos basados en IA
¿Se puede enriquecer o mejorar?
Sí Es posible añadir anotaciones estructurales (áreas de texto, jerarquía) o combinar este corpus con las imágenes originales para los modelos visio-textuales. También es posible añadir varios idiomas o formatos (por ejemplo, manuscritos).
🔎 En resumen
🧠 Recomendado para
- Ingenieros de datos de OCR
- Desarrolladores de motores de lectura automática de documentos
- Proyectos de archivo digital
🔧 Herramientas compatibles
- PyTesseract
- Hugging Face Transformers
- Donut
- TrOCR
- LayoutLM
💡 Consejo
Filtra los ejemplos con poca confianza en el OCR para mejorar la calidad de los juegos de entrenamiento.
Preguntas frecuentes
¿Este conjunto de datos incluye las imágenes originales de los documentos?
No, solo contiene el texto extraído y los metadatos asociados. No se proporciona la imagen de origen.
¿Se puede usar para entrenar un modelo de OCR completo?
Sí, pero tendrá que combinarse con imágenes similares para la fase visual. El conjunto de datos sigue siendo útil para el preprocesamiento de texto.
¿El contenido cubre varios idiomas o solo el inglés?
El conjunto de datos es principalmente inglés. Sin embargo, se puede enriquecer para aplicaciones multilingües.




