Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
RefBlock
Multimodal

RefBlock

Conjunto de datos multimodal diseñado para detectar y vincular bloques de texto que contienen referencias científicas en documentos PDF, útiles para capacitar o evaluar modelos de revisión de la literatura.

Obtén el dataset
Tamaño

1250 ejemplos, 18 MB, formato Parquet

Licencia

CC-BY 4.0

Descripción

‍

RefBlock es un conjunto de datos multimodal que combina fragmentos de texto, bloques de posicionamiento en documentos PDF y metadatos de referencias científicas. Está diseñado para entrenar o evaluar sistemas que pueden localizar y vincular citas en documentos complejos, como artículos académicos. Cada entrada incluye un fragmento de texto, coordenadas de bloques y datos sobre la referencia citada.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Detecta automáticamente las citas en archivos PDF académicos
  • Formación de modelos para el enlace entre el texto y las referencias bibliográficas
  • Creación de sistemas de análisis o indexación para archivos científicos

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, RefBlock se puede enriquecer con otros formatos de documentos (por ejemplo, Word, LaTeX), idiomas adicionales o anotaciones de tipo de cita (directas, indirectas). Agregar metadatos adicionales a los documentos fuente o estandarizar los estilos bibliográficos también puede aumentar su valor.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Requiere lectura de coordenadas de bloques)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos bien formateados)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno, con bloques + texto + metadatos)
📜 Licencia comercial✅ Sí (CC-BY 4.0)
👨‍💻 Ideal para principiantes⚠️ Requiere conocimientos básicos de manipulación de PDF
🔁 Reutilizable para fine-tuning🎯 Pertinente para entrenamiento con datos estructurados en PDF
🌍 Diversidad cultural⚠️ Principalmente anglófono – a ampliar

‍

‍

🧠 Recomendado para

  • Ingenieros académicos de PNL
  • Investigadores de extracción de información
  • Proyectos OCR+LLM

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • PyMuPDF
  • LayoutLM
  • GROBID
  • PDFMiner

‍

‍

💡 Consejo

Utilice las coordenadas de bloque para visualizar las áreas de atención en modelos multimodales.

Preguntas frecuentes

¿Este conjunto de datos contiene los PDF de origen?

No, solo contiene las coordenadas de los bloques extraídos y su contenido textual, así como los metadatos asociados.

¿Se puede usar para entrenar un modelo de OCR?

No es un conjunto de datos de OCR sin procesar, pero puede complementar los conjuntos de OCR para el análisis posterior o la alineación del texto y la estructura.

¿RefBlock es adecuado para buscar plagio o similitud textual?

Sí, al analizar las referencias cruzadas y los bloques de citas, se puede utilizar como base para proyectos para detectar similitudes o plagio.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.