SuperGPQA – Évaluation LLM sur 285 disciplines
SuperGPQA est un benchmark QA massif couvrant 285 disciplines académiques, conçu pour tester la compréhension et les capacités de raisonnement des LLMs.
Plus de 10 000 exemples QA multithématiques, format JSON structuré
ODC-BY
Description
SuperGPQA est un jeu de données de question-réponse couvrant un large éventail de disciplines académiques, allant du droit à la médecine, en passant par les mathématiques, la musique ou encore l'informatique. Ce benchmark vise à tester les capacités des grands modèles de langage (LLMs) à comprendre, raisonner et répondre de manière pertinente dans des domaines complexes et spécialisés.
À quoi sert ce dataset ?
- Évaluer les performances des LLMs sur des tâches de QA multi-domaines
- Servir de base pour entraîner ou tester des modèles spécialisés en connaissances générales ou universitaires
- Analyser la robustesse des modèles face à des questions complexes issues de 285 disciplines
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible d’ajouter d'autres disciplines, de traduire les contenus pour un usage multilingue ou encore de l’adapter à des niveaux éducatifs différents (licence, lycée, etc.). Des annotations supplémentaires peuvent être ajoutées (niveau de difficulté, justification des réponses...).
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP
- Concepteurs de benchmarks
- Ingénieurs QA LLM
🔧 Outils compatibles
- LangChain
- Transformers
- EvalGauntlet
- Weights & Biases
💡 Astuce
Filtrer les domaines spécifiques (ex : droit, médecine) pour faire des micro-évaluations ciblées de votre modèle.
Questions fréquemment posées
Est-ce que SuperGPQA peut être utilisé pour le fine-tuning ?
Oui, bien que conçu pour l’évaluation, sa diversité le rend utile pour ajuster un modèle sur des tâches spécialisées en QA.
Est-il nécessaire de respecter d'autres licences en plus de la licence ODC-BY ?
Oui, certains extraits proviennent d'autres datasets sous licence libre. Il faut respecter les conditions associées si vous les réutilisez isolément.
Est-ce adapté à un usage en langue française ?
Le dataset est en anglais. Pour un usage en français, une traduction automatique suivie d'une validation manuelle est recommandée.




