En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
RefBlock
Multimodal

RefBlock

Dataset multimodal conçu pour détecter et relier les blocs de texte contenant des références scientifiques dans des documents PDF, utile pour l’entraînement ou l’évaluation de modèles d’analyse documentaire.

Télécharger le dataset
Taille

1 250 exemples, 18 Mo, format Parquet

Licence

CC-BY 4.0

Description

‍

RefBlock est un dataset multimodal qui regroupe des extraits textuels, des blocs de positionnement dans des documents PDF et des métadonnées de références scientifiques. Il est pensé pour entraîner ou évaluer des systèmes capables de localiser et relier des citations dans des documents complexes comme les articles académiques. Chaque entrée comprend un extrait textuel, des coordonnées de bloc et des données sur la référence citée.

‍

‍

À quoi sert ce dataset ?

‍

  • Détecter automatiquement les citations dans des documents PDF académiques
  • Former des modèles pour le lien entre texte et références bibliographiques
  • Construire des systèmes de parsing ou d’indexation pour archives scientifiques

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, RefBlock peut être enrichi avec d'autres formats de documents (par exemple Word, LaTeX), des langues supplémentaires ou des annotations de types de citations (directe, indirecte). L’ajout de métadonnées complémentaires sur les documents sources ou une normalisation des styles bibliographiques peut également accroître sa valeur.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Nécessite une lecture des coordonnées de blocs)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – Données bien formatées)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne, avec blocs + texte + métadonnées)
📜 Licence commerciale✅ Oui (CC-BY 4.0)
👨‍💻 Idéal pour les débutants⚠️ Requiert une base en manipulation PDF
🔁 Réutilisable en fine-tuning🎯 Pertinent pour entraînement sur données structurées PDF
🌍 Diversité culturelle⚠️ Principalement anglophone – à étendre

‍

‍

🧠 Recommandé pour

  • Ingénieurs NLP académiques
  • Chercheurs en extraction d’information
  • Projets OCR+LLM

‍

‍

🔧 Outils compatibles

  • Hugging Face Datasets
  • PyMuPDF
  • LayoutLM
  • GROBID
  • PDFMiner

‍

‍

💡 Astuce

Utilisez les coordonnées de blocs pour visualiser les zones d’attention des modèles multimodaux.

Questions fréquemment posées

Ce dataset contient-il les fichiers PDF sources ?

Non, il contient uniquement les coordonnées des blocs extraits et leurs contenus textuels, ainsi que les métadonnées associées.

Peut-on l'utiliser pour entraîner un modèle d'OCR ?

Ce n’est pas un dataset OCR brut, mais il peut compléter des jeux OCR pour la phase de post-analyse ou d’alignement de texte et de structure.

Est-ce que RefBlock est adapté à la recherche de plagiat ou de similarité textuelle ?

Oui, en analysant les références croisées et les blocs de citations, il peut servir de base pour des projets de détection de similarités ou de plagiat.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.