Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
BillSum - Resúmenes de las leyes estadounidenses
Texto

BillSum - Resúmenes de las leyes estadounidenses

El conjunto de datos BillSum reúne textos completos de proyectos de ley estadounidenses y de California con sus correspondientes resúmenes, lo que resulta ideal para las tareas de resumen automático.

Obtén el dataset
Tamaño

Aproximadamente 23 000 documentos, textos y resúmenes en JSON, con un tamaño total de aproximadamente 340 MB

Licencia

CC0 1.0

Descripción

‍

El conjunto de datos BillSum contiene textos legislativos del Congreso de los Estados Unidos y del Estado de California con resúmenes resumidos. Cada entrada incluye el texto completo del proyecto de ley, un resumen y, a veces, un título. Este corpus está estructurado para permitir la formación de modelos capaces de generar automáticamente resúmenes precisos de documentos legales de gran tamaño.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Capacite modelos de resumen para textos legislativos
  • Facilitar la búsqueda y la comprensión de documentos legales complejos
  • Desarrolle asistentes legales automatizados para resumir la información

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, BillSum se puede enriquecer añadiendo anotaciones sobre los tipos de leyes, metadatos temporales o enlaces a las decisiones judiciales asociadas. Los resúmenes multilingües o simplificados también podrían mejorar su accesibilidad.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Datos listos para usar, JSON claro)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos bien formateados)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Resúmenes proporcionados, pero anotaciones limitadas)
📜 Licencia comercial✅ Sí (CC0 1.0)
👨‍💻 Ideal para principiantes🌟 Adecuado para empezar en NLP legal
🔁 Reutilizable para fine-tuning🎯 Perfecto para fine-tuning en summarization
🌍 Diversidad cultural⚠️ Centrado en legislación US/California

‍

‍

🧠 Recomendado para

  • Investigadores legales de PNL
  • Desarrolladores de resúmenes automáticos
  • Analistas legales

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • BART
  • Pegasus
  • SpaCy

‍

‍

💡 Consejo

Para obtener mejores resultados, limpie las secciones largas y repetitivas y pruebe la generación en subconjuntos temáticos.

Preguntas frecuentes

¿Este conjunto de datos solo contiene textos estadounidenses?

Sí, incluye únicamente proyectos de ley del Congreso de los Estados Unidos y del estado de California.

¿Los resúmenes se generan de forma automática o manual?

Los resúmenes se crearon manualmente, lo que garantiza una formación de alta calidad.

¿Se puede usar este conjunto de datos para entrenar modelos multilingües?

No, el corpus solo está en inglés. Sin embargo, es posible combinarlo con otros conjuntos de datos para fines multilingües.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.