DROP – Benchmark de compréhension avec raisonnement
DROP est un jeu de données avancé de compréhension de texte, conçu pour évaluer la capacité d’un système à répondre à des questions complexes en s’appuyant sur des opérations discrètes (comptage, tri, calcul) à partir de longs paragraphes.
Environ 86 000 exemples, format JSON avec paragraphes, questions, réponses
CC-BY-SA 4.0
Description
DROP (Discrete Reasoning Over Paragraphs) est un benchmark de lecture composé de plus de 86 000 questions en anglais. Il met au défi les modèles de langage en leur demandant de lire des paragraphes et de répondre à des questions nécessitant un raisonnement symbolique : comptage, comparaison, extraction d’entités ou addition. Les données sont issues d’un processus collaboratif et adversarial afin d’augmenter la difficulté du dataset.
À quoi sert ce dataset ?
- Évaluer ou entraîner des modèles de QA complexes basés sur des paragraphes
- Tester la capacité d’un LLM à effectuer un raisonnement discret (nombre, dates, quantités, etc.)
- Renforcer la compréhension contextuelle dans les systèmes d’IA
Peut-on l’enrichir ou l’améliorer ?
Oui. Le dataset peut être traduit ou adapté à d'autres langues. De nouveaux types de questions (tri, calculs temporels, reformulations) peuvent être ajoutés pour enrichir la variété. Des métadonnées (ex. : niveau de difficulté, type de question) peuvent aussi affiner son utilisation en apprentissage supervisé ou auto-supervisé.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en QA
- Fine-tuning de LLMs
- Évaluation de la logique symbolique
🔧 Outils compatibles
- Hugging Face Transformers
- T5
- DeBERTa
- OpenAI GPT
💡 Astuce
Utilisez des modèles capables de chaîner plusieurs étapes de raisonnement pour de meilleurs résultats (e.g. T5 avec prompting en plusieurs tours).
Questions fréquemment posées
En quoi DROP diffère-t-il des autres datasets de QA ?
Contrairement aux QA simples, DROP exige des calculs, du comptage ou du tri à partir du texte, ce qui en fait un benchmark plus exigeant.
Peut-on utiliser ce dataset pour du few-shot learning ?
Oui, en sélectionnant des exemples de types de questions variés, DROP peut servir dans des configurations few-shot ou chain-of-thought.
Est-il adapté aux modèles multilingues ?
Le dataset est en anglais uniquement, mais peut être traduit ou adapté à d'autres langues pour des expérimentations multilingues.




