DuoRC — Preguntas/respuestas sobre la sinopsis de la película
DuoRC es un conjunto de datos de control de calidad en inglés basado en resúmenes de películas tomados de Wikipedia e IMDb. Contiene dos versiones de las preguntas: una alineada con el pasaje original (SelfRC) y la otra formulada en un pasaje paralelo (ParaphraSerc), lo que promueve una comprensión profunda del texto y la paráfrasis.
187 213 ejemplos, formato de texto JSON, dos subconjuntos (selfRC, paraphraserc)
MIT
Descripción
Duo RC es un corpus de control de calidad compuesto por más de 187 000 pares de preguntas/respuestas creados a partir de escenarios cinematográficos. Los datos se dividen en dos partes: AutoRC (preguntas y respuestas del mismo texto de Wikipedia) y Paráfrasis RC (preguntas de Wikipedia y respuestas de IMDb). Esta desalineación voluntaria permite poner a prueba la capacidad de un modelo para razonar, parafrasear o sintetizar una respuesta.
¿Para qué sirve este conjunto de datos?
- Forme modelos por Respuesta extractiva a preguntas o abstractivo
- Evalúe la comprensión del texto a través de pasajes paralelos (Wikipedia frente a IMDb)
- Fortalecer las capacidades de paráfrasis y respuesta generativa de un modelo
¿Se puede enriquecer o mejorar?
Sí, DuoRC se puede extender a otras fuentes narrativas (series, libros) o a otros idiomas. También es posible clasificar las preguntas por tipos (causales, fácticas, inferenciales) o añadir anotaciones de complejidad o género cinematográfico para ajustarlas de forma especializada.
🔎 En resumen
🧠 Recomendado para
- Investigadores de PNL
- Ajustar los modelos de control de calidad
- Proyectos resumidos en texto
🔧 Herramientas compatibles
- Hugging Face Transformers
- BERT QA
- T5
- BART
- Haystack
💡 Consejo
Para evaluar la generalización, entrénese en SelfRC y pruebe en Paraphraserc: esto mide la solidez frente a la desalineación semántica.
Preguntas frecuentes
¿Cuál es la diferencia entre SelfRC y Paraphraserc?
SelfRC usa preguntas y respuestas extraídas del mismo pasaje, mientras que Paraphraserc ofrece respuestas de pasajes diferentes pero relacionados.
¿El conjunto de datos es adecuado para generar respuestas largas?
Sí, especialmente con la parte ParaphraSerc, que favorece las respuestas generativas y parafraseadas en lugar de las extractivas.
¿DuoRC contiene metadatos de películas o géneros?
No, el conjunto de datos se basa únicamente en las sinopsis y no contiene metadatos adicionales de la película.




