En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
DuoRC – Questions/Réponses sur synopsis de films
Texte

DuoRC – Questions/Réponses sur synopsis de films

DuoRC est un dataset QA en anglais basé sur des résumés de films tirés de Wikipedia et IMDb. Il contient deux versions de questions : l'une alignée avec le passage source (SelfRC), l'autre posée sur un passage parallèle (ParaphraseRC), favorisant une compréhension profonde du texte et la paraphrase.

Télécharger le dataset
Taille

187 213 exemples, format texte JSON, deux sous-ensembles (SelfRC, ParaphraseRC)

Licence

MIT

Description

‍

DuoRC est un corpus QA constitué de plus de 187 000 paires question/réponse construites à partir de scénarios de films. Les données sont divisées en deux parties : SelfRC (questions et réponses issues du même texte Wikipedia) et ParaphraseRC (questions issues de Wikipedia et réponses données depuis IMDb). Ce désalignement volontaire permet de tester la capacité d’un modèle à raisonner, paraphraser, ou synthétiser une réponse.

‍

‍

À quoi sert ce dataset ?

‍

  • Former des modèles en Question Answering extractif ou abstractive
  • Évaluer la compréhension de texte à travers des passages parallèles (Wikipedia vs IMDb)
  • Renforcer les capacités de paraphrase et de réponse générative d’un modèle

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, DuoRC peut être étendu à d'autres sources narratives (séries, livres) ou à d'autres langues. Il est aussi possible de classifier les questions par types (causales, factuelles, inférentielles) ou d’ajouter des annotations de complexité ou de genre cinématographique pour des fine-tuning spécialisés.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Utilisable directement avec les modèles QA courants)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – données bien structurées en JSON)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Deux variantes de QA - alignée / désalignée)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants⚠️ Accessible, mais nécessite une bonne maîtrise des tâches QA
🔁 Réutilisable en fine-tuning🎯 Excellente base pour modèles type BERT, T5, BART
🌍 Diversité culturelle⚠️ Centré sur des films US, mais extrapolable

‍

‍

🧠 Recommandé pour

  • Chercheurs NLP
  • Fine-tuning de modèles de QA
  • Projets de synthèse de texte

‍

‍

🔧 Outils compatibles

  • Hugging Face Transformers
  • BERT QA
  • T5
  • BART
  • Haystack

‍

‍

💡 Astuce

Pour évaluer la généralisation, entraînez sur SelfRC et testez sur ParaphraseRC : cela mesure la robustesse au désalignement sémantique.

Questions fréquemment posées

Quelle est la différence entre SelfRC et ParaphraseRC ?

SelfRC utilise des questions et réponses tirées du même passage, tandis que ParaphraseRC propose des réponses à partir de passages différents mais liés.

Le dataset est-il adapté à la génération de réponses longues ?

Oui, notamment avec la partie ParaphraseRC qui favorise des réponses génératives et paraphrasées plutôt qu’extractives.

DuoRC contient-il des métadonnées sur les films ou les genres ?

Non, le dataset est uniquement basé sur les synopsis et ne contient pas de métadonnées cinématographiques supplémentaires.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.