RefBlock
Conjunto de datos multimodal diseñado para detectar y vincular bloques de texto que contienen referencias científicas en documentos PDF, útiles para capacitar o evaluar modelos de revisión de la literatura.
Descripción
RefBlock es un conjunto de datos multimodal que combina fragmentos de texto, bloques de posicionamiento en documentos PDF y metadatos de referencias científicas. Está diseñado para entrenar o evaluar sistemas que pueden localizar y vincular citas en documentos complejos, como artículos académicos. Cada entrada incluye un fragmento de texto, coordenadas de bloques y datos sobre la referencia citada.
¿Para qué sirve este conjunto de datos?
- Detecta automáticamente las citas en archivos PDF académicos
- Formación de modelos para el enlace entre el texto y las referencias bibliográficas
- Creación de sistemas de análisis o indexación para archivos científicos
¿Se puede enriquecer o mejorar?
Sí, RefBlock se puede enriquecer con otros formatos de documentos (por ejemplo, Word, LaTeX), idiomas adicionales o anotaciones de tipo de cita (directas, indirectas). Agregar metadatos adicionales a los documentos fuente o estandarizar los estilos bibliográficos también puede aumentar su valor.
🔎 En resumen
🧠 Recomendado para
- Ingenieros académicos de PNL
- Investigadores de extracción de información
- Proyectos OCR+LLM
🔧 Herramientas compatibles
- Hugging Face Datasets
- PyMuPDF
- LayoutLM
- GROBID
- PDFMiner
💡 Consejo
Utilice las coordenadas de bloque para visualizar las áreas de atención en modelos multimodales.
Preguntas frecuentes
¿Este conjunto de datos contiene los PDF de origen?
No, solo contiene las coordenadas de los bloques extraídos y su contenido textual, así como los metadatos asociados.
¿Se puede usar para entrenar un modelo de OCR?
No es un conjunto de datos de OCR sin procesar, pero puede complementar los conjuntos de OCR para el análisis posterior o la alineación del texto y la estructura.
¿RefBlock es adecuado para buscar plagio o similitud textual?
Sí, al analizar las referencias cruzadas y los bloques de citas, se puede utilizar como base para proyectos para detectar similitudes o plagio.




