Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Qasper — Preguntas/respuestas sobre artículos científicos
Texto

Qasper — Preguntas/respuestas sobre artículos científicos

Qasper es un corpus científico de control de calidad basado en artículos de PNL de texto completo, con anotaciones manuales de respuestas y pruebas dentro del documento. Ideal para modelos de lectura prolongada o revisión de la literatura.

Obtén el dataset
Tamaño

5.049 preguntas sobre 1.585 artículos, JSON estructurado (texto, preguntas, respuestas, anotaciones)

Licencia

CC-BY 4.0

Descripción

Qasper es un conjunto de datos diseñado para la pregunta y la respuesta sobre artículos científicos en PNL. Cada ejemplo se basa en un artículo científico completo, con una o más preguntas formuladas a partir del título y el resumen, y luego respondidas leyendo el texto completo. Las respuestas van acompañadas de pruebas extraídas del cuerpo del texto, lo que las convierte en un conjunto de datos excelente para entrenar y evaluar modelos de «lectura prolongada» o de «razonamiento basado en la evidencia».

¿Para qué sirve este conjunto de datos?

  • Entrene modelos que puedan leer un artículo científico completo para responder a preguntas específicas
  • Pruebe las arquitecturas Longformer o BigBird en tareas de selección de pruebas
  • Desarrollar sistemas de control de calidad científicos asistidos o de síntesis

¿Se puede enriquecer o mejorar?

Sí Es posible extender este corpus a otros campos científicos (más allá de la PNL), traducir las preguntas para crear una versión multilingüe o reforzar las anotaciones de la evidencia con puntuaciones de confianza o reformulaciones. La adición de anotaciones adicionales (nivel de dificultad, naturaleza de la pregunta, etc.) también permitiría usos más avanzados.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Moderado: estructura rica pero bien documentada)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – anotaciones fiables y coherentes)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Muy rico: respuestas, evidencia, niveles de experticia, etc.)
📜 Licencia comercial✅ Sí (CC-BY 4.0)
👨‍💻 Ideal para principiantes⚠️ Medio – requiere bases sólidas en NLP científico
🔁 Reutilizable para fine-tuning🎯 Perfecto para modelos de secuencia larga o QA documental
🌍 Diversidad cultural⚠️ Bajo: solo en inglés y centrado en NLP

🧠 Recomendado para

  • Ingenieros de PNL
  • Investigadores
  • Desarrolladores de motores de reproducción automática

🔧 Herramientas compatibles

  • Longformer
  • BigBird
  • Hugging Face Transformers
  • Pipelines OpenQA

💡 Consejo

Para maximizar el impacto, combine Qasper con modelos especializados para la exploración semántica o resumida científica.

Preguntas frecuentes

¿Qasper se limita a los artículos de PNL?

Sí, la versión actual del conjunto de datos se centra únicamente en los artículos de procesamiento automático del lenguaje (PNL).

¿Se puede entrenar a un modelo para que seleccione los pasajes más relevantes con Qasper?

Por supuesto, Qasper proporciona anotaciones obvias que son ideales para la tarea de seleccionar pasajes automáticamente.

¿Este conjunto de datos es adecuado para modelos largos como Longformer o GPT extendido?

Sí, el formato de texto completo con varios párrafos lo hace ideal para arquitecturas de lectura larga.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.