Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
OCRFlux Bench Single
Texto

OCRFlux Bench Single

Un punto de referencia multilingüe de 2000 páginas PDF con anotaciones en Markdown para probar las capacidades de análisis de documentos mediante OCR.

Obtén el dataset
Tamaño

2000 páginas anotadas (Markdown), bilingüe EN/ZH

Licencia

Apache 2.0

Descripción

‍

OCRFlux Bench Single es un punto de referencia de alta calidad diseñado para evaluar el rendimiento de los sistemas de OCR al analizar páginas PDF. Incluye 2000 páginas de documentos internos, anotadas manualmente en Markdown, inglés y chino. El objetivo es comprobar la fidelidad de los sistemas de OCR a la hora de convertir páginas PDF a formatos estructurados.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Evalúe la precisión de los OCR en documentos complejos (títulos, tablas, texto estructurado)
  • Pruebe modelos de OCR multilingües en contenido en inglés y chino
  • Mejore la generación de Markdown a partir del contenido visual (PDF, escaneo)

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, el conjunto de datos se puede ampliar a otros idiomas o tipos de documentos (por ejemplo, formularios, documentos legales). Los niveles de título, las distinciones entre secciones o la anotación precisa de las tablas (encabezado, cuerpo) también podrían enriquecer la estructura.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐⭐⭐ (estructura por página, formato claro)
🧼Necesidad de limpieza ⭐⭐⭐⭐⭐ (datos validados manualmente)
🏷️Riqueza de anotaciones ⭐⭐⭐⭐☆ (estructura Markdown precisa, incluyendo tablas HTML)
📜Licencia comercial ✅ Sí (Apache 2.0)
👨‍💻Ideal para principiantes 👨‍💻 Sí – ideal para pruebas de OCR/Markdown
🔁Reutilizable para fine-tuning 📐 Más útil como benchmark que para entrenamiento masivo
🌍Diversidad cultural 🌏 Bilingüe: inglés y chino

‍

‍

🧠 Recomendado para

  • programadores de OCR
  • Investigadores de extracción de texto
  • Proyectos de PDF a HTML

‍

‍

🔧 Herramientas compatibles

  • Tesseract
  • LayoutLMv3
  • PaddleOCR
  • PyMuPDF
  • Markdown-it

‍

‍

💡 Consejo

Utilice la versión HTML de las tablas para evitar la pérdida de información en estructuras complejas.

Preguntas frecuentes

¿Se puede usar este conjunto de datos para entrenar un modelo de OCR?

Más bien, está diseñado para la evaluación, pero puede usarse como base para ajustar con precisión el Markdown estructurado.

¿Qué formato se usa para las anotaciones de las tablas?

Las tablas se representan en HTML en Markdown para administrar las celdas combinadas (rowspan, colspan).

¿El conjunto de datos contiene documentos en idiomas distintos del inglés y el chino?

No, la versión actual está limitada al inglés y al chino. Sin embargo, es posible ampliarla a otros idiomas con documentos anotados según la misma estructura.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.