BillSum - Résumés des lois américaines
Le dataset BillSum rassemble des textes complets de projets de loi américains et californiens avec leurs résumés correspondants, idéal pour les tâches de summarization automatique.
Environ 23 000 documents, textes et résumés en JSON, taille totale ~340 MB
CC0 1.0
Description
Le dataset BillSum contient des textes législatifs du Congrès américain et de l'État de Californie accompagnés de résumés synthétiques. Chaque entrée inclut le texte intégral du projet de loi, un résumé, et parfois un titre. Ce corpus est structuré pour permettre la formation de modèles capables de générer automatiquement des résumés précis de documents juridiques volumineux.
À quoi sert ce dataset ?
- Entraîner des modèles de summarization pour textes législatifs
- Faciliter la recherche et la compréhension de documents juridiques complexes
- Développer des assistants juridiques automatisés pour la synthèse d’information
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible d’enrichir BillSum en ajoutant des annotations sur les types de lois, des métadonnées temporelles ou des liens vers des décisions judiciaires associées. Des résumés multilingues ou simplifiés pourraient aussi améliorer son accessibilité.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs NLP juridique
- Développeurs de résumés automatiques
- Analystes juridiques
🔧 Outils compatibles
- Hugging Face Transformers
- BART
- Pegasus
- SpaCy
💡 Astuce
Pour de meilleurs résultats, nettoyer les longues sections répétitives et tester la génération sur des sous-ensembles thématiques.
Questions fréquemment posées
Ce dataset contient-il uniquement des textes américains ?
Oui, il comprend des projets de loi du Congrès américain et de l’État de Californie uniquement.
Les résumés sont-ils générés automatiquement ou manuellement ?
Les résumés ont été créés manuellement, assurant une qualité élevée pour l’entraînement.
Peut-on utiliser ce dataset pour entraîner des modèles multilingues ?
Non, le corpus est uniquement en anglais. Toutefois, il est possible de le combiner avec d’autres datasets pour du multilingue.




