Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
olmOCR PES2O Dataset
Imagen

olmOCR PES2O Dataset

Corpus masivo de OCR de documentos escaneados, utilizado para el reconocimiento óptico de caracteres y el modelado de texto extraído.

Obtén el dataset
Tamaño

7,8 millones de líneas, archivos de texto y metadatos estructurados

Licencia

DOC-POR

Descripción

‍

OlmoCR-PES2O-0225 es un enorme conjunto de datos de código abierto diseñado para las tareas de reconocimiento óptico de caracteres (OCR). Contiene millones de ejemplos de documentos escaneados. Cada línea representa una instancia de OCR con el texto extraído y los metadatos asociados. Está diseñado para usarse al mismo tiempo en el entrenamiento, la evaluación y el análisis del rendimiento de los sistemas de OCR modernos.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos de OCR que puedan extraer texto de documentos reales
  • Pruebe la solidez de los modelos en una amplia gama de tipos de documentos
  • Creación de canales de procesamiento de documentos basados en IA

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí Es posible añadir anotaciones estructurales (áreas de texto, jerarquía) o combinar este corpus con las imágenes originales para los modelos visio-textuales. También es posible añadir varios idiomas o formatos (por ejemplo, manuscritos).

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Simple de parsear, archivos bien estructurados)
🧼 Necesidad de limpieza⭐⭐⭐⭐✩ (Bajo – datos coherentes pero pueden requerir validación OCR)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Moderado – texto bruto + algunas metadatos, sin segmentación visual)
📜 Licencia comercial✅ Sí (ODC-BY)
👨‍💻 Ideal para principiantes⚠️ Sí, si se dominan herramientas OCR
🔁 Reutilizable para fine-tuning🎯 Perfecto para afinar modelos OCR tipo Tesseract, Donut, TrOCR
🌍 Diversidad cultural⚠️ No especificado – contenido principalmente anglófono

‍

‍

🧠 Recomendado para

  • Ingenieros de datos de OCR
  • Desarrolladores de motores de lectura automática de documentos
  • Proyectos de archivo digital

‍

‍

🔧 Herramientas compatibles

  • PyTesseract
  • Hugging Face Transformers
  • Donut
  • TrOCR
  • LayoutLM

‍

‍

💡 Consejo

Filtra los ejemplos con poca confianza en el OCR para mejorar la calidad de los juegos de entrenamiento.

Preguntas frecuentes

¿Este conjunto de datos incluye las imágenes originales de los documentos?

No, solo contiene el texto extraído y los metadatos asociados. No se proporciona la imagen de origen.

¿Se puede usar para entrenar un modelo de OCR completo?

Sí, pero tendrá que combinarse con imágenes similares para la fase visual. El conjunto de datos sigue siendo útil para el preprocesamiento de texto.

¿El contenido cubre varios idiomas o solo el inglés?

El conjunto de datos es principalmente inglés. Sin embargo, se puede enriquecer para aplicaciones multilingües.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.