En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Multi-subject RLVR
Texte

Multi-subject RLVR

Corpus de QA multithématique issu de l’examen chinois ExamQA, comprenant près de 580 000 paires question-réponse traduites en anglais. Les données couvrent 48 disciplines universitaires (droit, médecine, informatique, économie, etc.) classées en 4 grands domaines : sciences, sciences humaines, sociales et appliquées.

Télécharger le dataset
Taille

579 002 paires QA au format texte (Parquet) – 73,7 Mo

Licence

Apache-2.0

Description

‍

Multi-subject RLVR est un jeu de données de questions-réponses universitaires massivement multithématique. Basé sur le corpus chinois ExamQA, il propose des paires QA traduites en anglais, avec une catégorisation automatique des sujets à l'aide de GPT-4o-mini.

‍

‍

À quoi sert ce dataset ?

‍

  • Former ou évaluer des modèles QA multithématiques
  • Effectuer du fine-tuning sur des tâches de compréhension académique
  • Servir de base d’entraînement pour des approches RLHF ou RLAIF dans un contexte éducatif

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui. On pourrait :

  • Ajouter des explications pour chaque réponse (step-by-step)
  • Étiqueter les niveaux de difficulté
  • Traduire les questions dans d'autres langues ou réintroduire les distracteurs pour du QA à choix multiples

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation✅ Très bien structuré (question + réponse)
🧼 Besoin de nettoyage🔍 Faible – données revues et traduites
🏷️ Richesse des annotations📚 Domaines variés mais réponses courtes (pas d'explication)
📜 Licence commerciale✅ Oui (Apache-2.0)
👨‍🏫 Idéal pour les débutants👨‍🏫 Oui, corpus clair pour entraînement ou tests de QA
🔥 Réutilisable en fine-tuning🔥 Excellente base pour le NLP éducatif ou généraliste
🌐 Diversité culturelle🌐 Origine chinoise, traduit en anglais

‍

‍

🧠 Recommandé pour

  • Développeurs d’IA éducatives
  • Chercheurs en QA multithématique
  • Projets RLHF

‍

‍

🔧 Outils compatibles

  • OpenAssistant
  • LangChain
  • Transformers
  • LLaMA
  • Mistral
  • Claude

‍

‍

💡 Astuce

Filtrez les domaines souhaités (STEM, droit, économie, etc.) selon vos cas d’usage pour spécialiser votre modèle.

Questions fréquemment posées

Ce dataset contient-il uniquement des questions à choix multiple ?

Non, les distracteurs ont été supprimés pour convertir chaque exemple en paire QA libre (question + réponse).

Est-il possible de filtrer par domaine ou matière ?

Oui, chaque QA est classée automatiquement dans l’un des 48 sujets ou regroupée en 4 domaines généraux (STEM, sciences sociales, etc.).

Peut-on utiliser ce dataset pour entraîner un modèle de chatbot éducatif ?

Oui, c’est un excellent choix pour le fine-tuning d’un assistant académique ou d’un modèle de tutorat automatisé.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.