DuoRC – Questions/Réponses sur synopsis de films
DuoRC est un dataset QA en anglais basé sur des résumés de films tirés de Wikipedia et IMDb. Il contient deux versions de questions : l'une alignée avec le passage source (SelfRC), l'autre posée sur un passage parallèle (ParaphraseRC), favorisant une compréhension profonde du texte et la paraphrase.
187 213 exemples, format texte JSON, deux sous-ensembles (SelfRC, ParaphraseRC)
MIT
Description
DuoRC est un corpus QA constitué de plus de 187 000 paires question/réponse construites à partir de scénarios de films. Les données sont divisées en deux parties : SelfRC (questions et réponses issues du même texte Wikipedia) et ParaphraseRC (questions issues de Wikipedia et réponses données depuis IMDb). Ce désalignement volontaire permet de tester la capacité d’un modèle à raisonner, paraphraser, ou synthétiser une réponse.
À quoi sert ce dataset ?
- Former des modèles en Question Answering extractif ou abstractive
- Évaluer la compréhension de texte à travers des passages parallèles (Wikipedia vs IMDb)
- Renforcer les capacités de paraphrase et de réponse générative d’un modèle
Peut-on l’enrichir ou l’améliorer ?
Oui, DuoRC peut être étendu à d'autres sources narratives (séries, livres) ou à d'autres langues. Il est aussi possible de classifier les questions par types (causales, factuelles, inférentielles) ou d’ajouter des annotations de complexité ou de genre cinématographique pour des fine-tuning spécialisés.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs NLP
- Fine-tuning de modèles de QA
- Projets de synthèse de texte
🔧 Outils compatibles
- Hugging Face Transformers
- BERT QA
- T5
- BART
- Haystack
💡 Astuce
Pour évaluer la généralisation, entraînez sur SelfRC et testez sur ParaphraseRC : cela mesure la robustesse au désalignement sémantique.
Questions fréquemment posées
Quelle est la différence entre SelfRC et ParaphraseRC ?
SelfRC utilise des questions et réponses tirées du même passage, tandis que ParaphraseRC propose des réponses à partir de passages différents mais liés.
Le dataset est-il adapté à la génération de réponses longues ?
Oui, notamment avec la partie ParaphraseRC qui favorise des réponses génératives et paraphrasées plutôt qu’extractives.
DuoRC contient-il des métadonnées sur les films ou les genres ?
Non, le dataset est uniquement basé sur les synopsis et ne contient pas de métadonnées cinématographiques supplémentaires.



