En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Texte

X-CSR

Le dataset X-CSR permet d’évaluer des modèles multilingues sur le raisonnement de bon sens via un protocole de transfert zéro-shot. Il contient deux sous-datasets traduits automatiquement (X-CSQA et X-CODAH) couvrant 16 langues, dont le français, l’anglais, le chinois, etc. Ces données sont issues de traductions automatiques des versions anglaises originales, fournissant un benchmark multilingue.

Télécharger le dataset
Taille

Contient des exemples traduits en 16 langues, format JSON, taille variable selon splits

Licence

MIT

Description

‍

X-CSR est un benchmark multilingue destiné à évaluer les capacités de raisonnement de bon sens des modèles de langage dans un contexte de transfert zéro-shot cross-lingue. Il comprend des versions traduites automatiquement des datasets CSQA et CODAH en 16 langues, dont le français.

‍

‍

À quoi sert ce dataset ?

‍

  • Tester la généralisation des modèles multilingues en raisonnement de bon sens
  • Évaluer le transfert zéro-shot de l’anglais vers d’autres langues
  • Fournir un benchmark unifié pour comparer différents modèles multilingues

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, en remplaçant les traductions automatiques par des traductions humaines plus précises et en étendant le nombre de langues ou d’exemples pour un benchmark plus robuste.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Données au format standard, mais nécessite gestion multilingue)
🧼 Besoin de nettoyage⭐⭐⭐✩✩ (Modéré à cause des traductions automatiques pouvant contenir des erreurs)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne, avec labels issus des datasets originaux)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants⚠️ Moyennement, conseillé pour utilisateurs avec expérience multilingue
🔁 Réutilisable en fine-tuning✅ Utile pour fine-tuning et évaluation multilingue
🌍 Diversité culturelle🈳 Large couverture de 16 langues incluant plusieurs familles linguistiques

‍

‍

🧠 Recommandé pour

  • Chercheurs en NLP multilingue
  • Développeurs de modèles multilingues
  • Équipes d’évaluation

‍

‍

🔧 Outils compatibles

  • Hugging Face Transformers
  • PyTorch
  • TensorFlow
  • Outils de traduction et d’évaluation multilingue

‍

‍

💡 Astuce

Pour un benchmark plus précis, combinez ces données avec des traductions humaines dès que possible.

Questions fréquemment posées

Combien de langues sont couvertes par le dataset X-CSR ?

Le dataset couvre 16 langues, dont le français, l’anglais, le chinois, l’allemand, l’espagnol, et bien d’autres.

Les traductions sont-elles faites par des humains ?

Non, les versions disponibles sont issues de traductions automatiques, ce qui peut introduire du bruit.

Peut-on utiliser ce dataset pour un usage commercial ?

Oui, la licence MIT permet une utilisation commerciale libre.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.