En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Ambig QA
Texte

Ambig QA

Dataset Ambig QA comprenant 14 042 questions extraites de NQ-open, annotées pour refléter diverses ambiguïtés détectées dans les questions ouvertes. Ce dataset aide à entraîner des modèles capables de gérer des questions à réponses multiples ou ambigües dans des contextes larges.

Télécharger le dataset
Taille

Environ 14 000 questions en JSON avec annotations diverses, format structuré pour QA ouverte

Licence

CC BY-SA 3.0

Description

‍

Ambig QA est un dataset d’environ 14 000 questions issues de NQ-open, annotées spécifiquement pour les ambiguïtés qui apparaissent dans les questions ouvertes en langage naturel. Ces annotations permettent de mieux comprendre les différents types d’ambiguïté et de préparer les modèles pour des réponses adaptées aux multiples interprétations possibles.

‍

‍

À quoi sert ce dataset ?

‍

  • Entraîner des modèles de question-answering à gérer l’ambiguïté dans les questions ouvertes
  • Évaluer la robustesse et la capacité de désambiguïsation des systèmes QA
  • Améliorer les agents conversationnels pour mieux interpréter les requêtes imprécises

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, le dataset peut être enrichi par des annotations supplémentaires concernant la nature des ambiguïtés, ou être étendu à d’autres langues et domaines pour améliorer la diversité des cas d’usage. Le remix avec d’autres datasets QA est aussi possible.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Format JSON standard, nécessite compréhension des annotations)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – dataset bien nettoyé et structuré)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Riche – annotations détaillées sur l’ambiguïté)
📜 Licence commerciale⚡ Oui, mais sous Share-Alike (CC BY-SA 3.0)
👨‍💻 Idéal pour les débutants⚠️ Moyen – utile pour ceux connaissant les bases du NLP QA
🔁 Réutilisable en fine-tuning🎯 Oui, parfait pour entraînements QA spécialisés
🌍 Diversité culturelle⚠️ Anglais, questions ouvertes variées

‍

‍

🧠 Recommandé pour

  • Chercheurs QA
  • Développeurs chatbot
  • Ingénieurs NLP

‍

‍

🔧 Outils compatibles

  • Hugging Face Transformers
  • SpaCy
  • AllenNLP
  • Outils d’annotation JSON

‍

‍

💡 Astuce

Utilisez les annotations d’ambiguïté pour créer des modèles capables de générer plusieurs réponses pertinentes.

Questions fréquemment posées

Qu’est-ce qui rend ce dataset unique pour les questions ouvertes ?

Il est spécifiquement annoté pour capturer et représenter différentes formes d’ambiguïté dans les questions ouvertes, ce qui est rare dans d’autres datasets QA.

Ce dataset peut-il être utilisé pour des tâches multilingues ?

Non, il est uniquement en anglais, mais le format peut être adapté pour d’autres langues via traduction et annotation.

Quelle licence s’applique et quelles sont les contraintes ?

Licence CC BY-SA 3.0, ce qui signifie que toute utilisation dérivée doit être partagée sous la même licence, favorisant le partage ouvert.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.