En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
PathVQA – Questions médicales sur images
Multimodal

PathVQA – Questions médicales sur images

Jeu de données VQA médical contenant plus de 32 000 paires question/réponse basées sur des images issues de manuels de pathologie. Il contient des questions ouvertes et binaires, et constitue une ressource précieuse pour entraîner des modèles combinant vision par ordinateur et traitement du langage naturel.

Télécharger le dataset
Taille

32 632 paires QA sur 4 289 images, formats image + texte

Licence

MIT

Description

‍

PathVQA est un jeu de données conçu pour la tâche de Visual Question Answering (VQA) dans le domaine médical. Il contient 32 632 paires question/réponse annotées manuellement à partir d’images de pathologie extraites de manuels spécialisés et d’une bibliothèque numérique. Le dataset inclut à la fois des questions ouvertes et des questions de type oui/non, couvrant divers sujets liés à l’anatomie, la biologie cellulaire ou la pathologie clinique.

‍

‍

À quoi sert ce dataset ?

‍

  • Former des modèles VQA spécialisés en imagerie médicale
  • Évaluer la compréhension visuelle et textuelle des modèles multimodaux
  • Servir de benchmark pour des tâches de QA visuelle en environnement médical

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui. Il est envisageable d’annoter les types de questions (anatomie, diagnostic, etc.) ou de catégoriser les images par organe ou pathologie. On peut aussi utiliser la base pour la génération d’images via IA à partir de QA ou l’intégrer dans des pipelines d’assistance médicale automatisée.

‍

‍

🔎 En résumé

Critère Évaluation
🧩Facilité d’utilisation ⭐⭐⭐☆☆ (moyenne – nécessite traitement multimodal image + texte)
🧼Besoin de nettoyage ⭐⭐⭐⭐⭐ (faible – données prêtes à l’emploi)
🏷️Richesse des annotations ⭐⭐⭐⭐☆ (bonne – questions ouvertes et oui/non couvrant de nombreux cas)
📜Licence commerciale ✅ Oui (MIT)
👨‍💻Idéal pour les débutants 🧪 Moyennement – nécessite gestion image+texte
🔁Réutilisable en fine-tuning 🔥 Oui – parfait pour modèles VQA ou CLIP médicaux
🌍Diversité culturelle 🌍 Limitée – contenu basé sur manuels anglophones classiques

‍

‍

🧠 Recommandé pour

  • Chercheurs en vision médicale
  • Développeurs VQA
  • Projets IA santé

‍

‍

🔧 Outils compatibles

  • PyTorch
  • OpenVQA
  • BLIP
  • LLaVA
  • Hugging Face Transformers

‍

‍

💡 Astuce

Filtrez les questions par type (binaire vs ouvert) pour créer des sous-tâches spécifiques pendant l’entraînement.

Questions fréquemment posées

Ce dataset peut-il être utilisé à des fins cliniques ?

Non, il est conçu pour la recherche en IA et ne doit pas être utilisé directement à des fins diagnostiques sans validation médicale.

Toutes les images sont-elles utilisées dans les paires QA ?

Non, seules 4 289 images sur les 5 004 sont effectivement associées à des questions.

Ce jeu de données est-il multilingue ?

Non, toutes les questions et réponses sont rédigées en anglais. Une version multilingue pourrait être envisagée avec traduction.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.