Ambig QA
Dataset Ambig QA comprenant 14 042 questions extraites de NQ-open, annotées pour refléter diverses ambiguïtés détectées dans les questions ouvertes. Ce dataset aide à entraîner des modèles capables de gérer des questions à réponses multiples ou ambigües dans des contextes larges.
Environ 14 000 questions en JSON avec annotations diverses, format structuré pour QA ouverte
CC BY-SA 3.0
Description
Ambig QA est un dataset d’environ 14 000 questions issues de NQ-open, annotées spécifiquement pour les ambiguïtés qui apparaissent dans les questions ouvertes en langage naturel. Ces annotations permettent de mieux comprendre les différents types d’ambiguïté et de préparer les modèles pour des réponses adaptées aux multiples interprétations possibles.
À quoi sert ce dataset ?
- Entraîner des modèles de question-answering à gérer l’ambiguïté dans les questions ouvertes
- Évaluer la robustesse et la capacité de désambiguïsation des systèmes QA
- Améliorer les agents conversationnels pour mieux interpréter les requêtes imprécises
Peut-on l’enrichir ou l’améliorer ?
Oui, le dataset peut être enrichi par des annotations supplémentaires concernant la nature des ambiguïtés, ou être étendu à d’autres langues et domaines pour améliorer la diversité des cas d’usage. Le remix avec d’autres datasets QA est aussi possible.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs QA
- Développeurs chatbot
- Ingénieurs NLP
🔧 Outils compatibles
- Hugging Face Transformers
- SpaCy
- AllenNLP
- Outils d’annotation JSON
💡 Astuce
Utilisez les annotations d’ambiguïté pour créer des modèles capables de générer plusieurs réponses pertinentes.
Questions fréquemment posées
Qu’est-ce qui rend ce dataset unique pour les questions ouvertes ?
Il est spécifiquement annoté pour capturer et représenter différentes formes d’ambiguïté dans les questions ouvertes, ce qui est rare dans d’autres datasets QA.
Ce dataset peut-il être utilisé pour des tâches multilingues ?
Non, il est uniquement en anglais, mais le format peut être adapté pour d’autres langues via traduction et annotation.
Quelle licence s’applique et quelles sont les contraintes ?
Licence CC BY-SA 3.0, ce qui signifie que toute utilisation dérivée doit être partagée sous la même licence, favorisant le partage ouvert.




