MedXpertQA
MedXpertQA est un benchmark médical expert combinant des tâches de question-réponse en texte seul ou avec des images cliniques. Il cible le raisonnement avancé, le diagnostic, et la compréhension de systèmes corporels.
4 460 questions (texte + images), formats JSONL et JPEG, divisées en dev/test pour QA médical textuel et multimodal
MIT
Description
MedXpertQA est un jeu de données médical conçu pour évaluer la capacité des modèles d’intelligence artificielle à comprendre et raisonner sur des cas cliniques complexes. Il se compose de deux sous-ensembles : l’un basé sur du texte (QA médical), et l’autre multimodal incluant des images (radiologies, examens cutanés, etc.) et des tableaux cliniques structurés. Le dataset couvre des spécialités diverses comme la dermatologie, l’oncologie, la médecine interne, etc.
À quoi sert ce dataset ?
- Tester la capacité des modèles à effectuer du raisonnement médical de haut niveau
- Former des modèles multimodaux à comprendre des cas médicaux illustrés par des images et des données tabulaires
- Servir de benchmark pour comparer différentes approches LLMs en médecine
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible d’ajouter de nouveaux cas cliniques, notamment issus de spécialités peu représentées ou de régions géographiques variées. On peut également enrichir les annotations en ajoutant des justifications aux réponses ou des explications cliniques détaillées. Le dataset est structuré de manière à faciliter l’extension et la réutilisation.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en IA médicale
- Développeurs de LLM pour la santé
- Projets de diagnostic assisté
🔧 Outils compatibles
- Hugging Face Transformers
- MedCLIP
- OpenBioLLM
- Outils d’analyse d’image médicale
💡 Astuce
Pour une meilleure généralisation, combinez ce dataset avec des sources multilingues et des explications médicales humaines.
Questions fréquemment posées
Ce dataset contient-il des données d’imagerie médicale ?
Oui, le sous-ensemble multimodal inclut des images cliniques (cutanées, radiologiques, etc.) en plus des questions textuelles.
Peut-on utiliser ce dataset pour former des LLM médicaux ?
Absolument. Il est idéal pour le fine-tuning et l’évaluation de modèles sur des tâches médicales complexes nécessitant du raisonnement.
Est-il conforme à un usage commercial ou clinique ?
Il est utilisable à des fins commerciales (licence MIT), mais reste un benchmark expérimental sans validation clinique réglementaire.




