BillSum - Resúmenes de las leyes estadounidenses
El conjunto de datos BillSum reúne textos completos de proyectos de ley estadounidenses y de California con sus correspondientes resúmenes, lo que resulta ideal para las tareas de resumen automático.
Aproximadamente 23 000 documentos, textos y resúmenes en JSON, con un tamaño total de aproximadamente 340 MB
CC0 1.0
Descripción
El conjunto de datos BillSum contiene textos legislativos del Congreso de los Estados Unidos y del Estado de California con resúmenes resumidos. Cada entrada incluye el texto completo del proyecto de ley, un resumen y, a veces, un título. Este corpus está estructurado para permitir la formación de modelos capaces de generar automáticamente resúmenes precisos de documentos legales de gran tamaño.
¿Para qué sirve este conjunto de datos?
- Capacite modelos de resumen para textos legislativos
- Facilitar la búsqueda y la comprensión de documentos legales complejos
- Desarrolle asistentes legales automatizados para resumir la información
¿Se puede enriquecer o mejorar?
Sí, BillSum se puede enriquecer añadiendo anotaciones sobre los tipos de leyes, metadatos temporales o enlaces a las decisiones judiciales asociadas. Los resúmenes multilingües o simplificados también podrían mejorar su accesibilidad.
🔎 En resumen
🧠 Recomendado para
- Investigadores legales de PNL
- Desarrolladores de resúmenes automáticos
- Analistas legales
🔧 Herramientas compatibles
- Hugging Face Transformers
- BART
- Pegasus
- SpaCy
💡 Consejo
Para obtener mejores resultados, limpie las secciones largas y repetitivas y pruebe la generación en subconjuntos temáticos.
Preguntas frecuentes
¿Este conjunto de datos solo contiene textos estadounidenses?
Sí, incluye únicamente proyectos de ley del Congreso de los Estados Unidos y del estado de California.
¿Los resúmenes se generan de forma automática o manual?
Los resúmenes se crearon manualmente, lo que garantiza una formación de alta calidad.
¿Se puede usar este conjunto de datos para entrenar modelos multilingües?
No, el corpus solo está en inglés. Sin embargo, es posible combinarlo con otros conjuntos de datos para fines multilingües.




