Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
DuoRC — Preguntas/respuestas sobre la sinopsis de la película
Texto

DuoRC — Preguntas/respuestas sobre la sinopsis de la película

DuoRC es un conjunto de datos de control de calidad en inglés basado en resúmenes de películas tomados de Wikipedia e IMDb. Contiene dos versiones de las preguntas: una alineada con el pasaje original (SelfRC) y la otra formulada en un pasaje paralelo (ParaphraSerc), lo que promueve una comprensión profunda del texto y la paráfrasis.

Obtén el dataset
Tamaño

187 213 ejemplos, formato de texto JSON, dos subconjuntos (selfRC, paraphraserc)

Licencia

MIT

Descripción

‍

Duo RC es un corpus de control de calidad compuesto por más de 187 000 pares de preguntas/respuestas creados a partir de escenarios cinematográficos. Los datos se dividen en dos partes: AutoRC (preguntas y respuestas del mismo texto de Wikipedia) y Paráfrasis RC (preguntas de Wikipedia y respuestas de IMDb). Esta desalineación voluntaria permite poner a prueba la capacidad de un modelo para razonar, parafrasear o sintetizar una respuesta.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Forme modelos por Respuesta extractiva a preguntas o abstractivo
  • Evalúe la comprensión del texto a través de pasajes paralelos (Wikipedia frente a IMDb)
  • Fortalecer las capacidades de paráfrasis y respuesta generativa de un modelo

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, DuoRC se puede extender a otras fuentes narrativas (series, libros) o a otros idiomas. También es posible clasificar las preguntas por tipos (causales, fácticas, inferenciales) o añadir anotaciones de complejidad o género cinematográfico para ajustarlas de forma especializada.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Usable directamente con modelos QA comunes)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos bien estructurados en JSON)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Dos variantes de QA - alineada / desalineada)
📜 Licencia comercial✅ Sí (MIT)
👨‍💻 Ideal para principiantes⚠️ Accesible, pero requiere buen dominio de tareas QA
🔁 Reutilizable para fine-tuning🎯 Excelente base para modelos tipo BERT, T5, BART
🌍 Diversidad cultural⚠️ Centrado en películas de US, pero extrapolable

‍

‍

🧠 Recomendado para

  • Investigadores de PNL
  • Ajustar los modelos de control de calidad
  • Proyectos resumidos en texto

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • BERT QA
  • T5
  • BART
  • Haystack

‍

‍

💡 Consejo

Para evaluar la generalización, entrénese en SelfRC y pruebe en Paraphraserc: esto mide la solidez frente a la desalineación semántica.

Preguntas frecuentes

¿Cuál es la diferencia entre SelfRC y Paraphraserc?

SelfRC usa preguntas y respuestas extraídas del mismo pasaje, mientras que Paraphraserc ofrece respuestas de pasajes diferentes pero relacionados.

¿El conjunto de datos es adecuado para generar respuestas largas?

Sí, especialmente con la parte ParaphraSerc, que favorece las respuestas generativas y parafraseadas en lugar de las extractivas.

¿DuoRC contiene metadatos de películas o géneros?

No, el conjunto de datos se basa únicamente en las sinopsis y no contiene metadatos adicionales de la película.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.