En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
BillSum - Résumés des lois américaines
Texte

BillSum - Résumés des lois américaines

Le dataset BillSum rassemble des textes complets de projets de loi américains et californiens avec leurs résumés correspondants, idéal pour les tâches de summarization automatique.

Télécharger le dataset
Taille

Environ 23 000 documents, textes et résumés en JSON, taille totale ~340 MB

Licence

CC0 1.0

Description

‍

Le dataset BillSum contient des textes législatifs du Congrès américain et de l'État de Californie accompagnés de résumés synthétiques. Chaque entrée inclut le texte intégral du projet de loi, un résumé, et parfois un titre. Ce corpus est structuré pour permettre la formation de modèles capables de générer automatiquement des résumés précis de documents juridiques volumineux.

‍

‍

À quoi sert ce dataset ?

‍

  • Entraîner des modèles de summarization pour textes législatifs
  • Faciliter la recherche et la compréhension de documents juridiques complexes
  • Développer des assistants juridiques automatisés pour la synthèse d’information

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, il est possible d’enrichir BillSum en ajoutant des annotations sur les types de lois, des métadonnées temporelles ou des liens vers des décisions judiciaires associées. Des résumés multilingues ou simplifiés pourraient aussi améliorer son accessibilité.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Données prêtes à l’emploi, JSON clair)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – données bien formatées)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Résumés fournis, mais annotations limitées)
📜 Licence commerciale✅ Oui (CC0 1.0)
👨‍💻 Idéal pour les débutants🌟 Adapté pour commencer en NLP légal
🔁 Réutilisable en fine-tuning🎯 Parfait pour le fine-tuning sur summarization
🌍 Diversité culturelle⚠️ Centré sur la législation US/Californie

‍

‍

🧠 Recommandé pour

  • Chercheurs NLP juridique
  • Développeurs de résumés automatiques
  • Analystes juridiques

‍

‍

🔧 Outils compatibles

  • Hugging Face Transformers
  • BART
  • Pegasus
  • SpaCy

‍

‍

💡 Astuce

Pour de meilleurs résultats, nettoyer les longues sections répétitives et tester la génération sur des sous-ensembles thématiques.

Questions fréquemment posées

Ce dataset contient-il uniquement des textes américains ?

Oui, il comprend des projets de loi du Congrès américain et de l’État de Californie uniquement.

Les résumés sont-ils générés automatiquement ou manuellement ?

Les résumés ont été créés manuellement, assurant une qualité élevée pour l’entraînement.

Peut-on utiliser ce dataset pour entraîner des modèles multilingues ?

Non, le corpus est uniquement en anglais. Toutefois, il est possible de le combiner avec d’autres datasets pour du multilingue.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.