Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
PathVQA – Questions médicales sur images
Multimodal

PathVQA – Questions médicales sur images

Conjunto de datos médicos de VQA que contiene más de 32 000 pares de preguntas/respuestas basados en imágenes de manuales de patología. Contiene preguntas abiertas y binarias, y es un recurso valioso para los modelos de formación que combinan la visión artificial y el procesamiento del lenguaje natural.

Obtén el dataset
Tamaño

32.632 pares de control de calidad en 4.289 imágenes, formatos de imagen y texto

Licencia

MIT

Descripción

‍

PathVQA es un conjunto de datos diseñado para la tarea de respuesta visual de preguntas (VQA) en el campo de la medicina. Contiene 32.632 pares de preguntas/respuestas anotadas manualmente a partir de imágenes de patología extraídas de libros de texto especializados y de una biblioteca digital. El conjunto de datos incluye preguntas abiertas y preguntas de tipo sí/no, que abarcan una variedad de temas relacionados con la anatomía, la biología celular o la patología clínica.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos VQA especializados en imágenes médicas
  • Evaluar la comprensión visual y textual de los modelos multimodales
  • Sirva como punto de referencia para las tareas de control de calidad visual en un entorno médico

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí. Es posible anotar los tipos de preguntas (anatomía, diagnóstico, etc.) o clasificar las imágenes por órgano o patología. La base de datos también se puede utilizar para generar imágenes mediante IA a partir del control de calidad o integrarlas en líneas de asistencia médica automatizadas.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐☆☆ (media – requiere procesamiento multimodal de imagen + texto)
🧼Limpieza necesaria ⭐⭐⭐⭐⭐ (baja – datos listos para usar)
🏷️Riqueza de anotaciones ⭐⭐⭐⭐☆ (buena – preguntas abiertas y sí/no cubriendo muchos casos)
📜Licencia comercial ✅ Sí (MIT)
👨‍💻Ideal para principiantes 🧪 Moderado – requiere manejo de imagen + texto
🔁Reutilizable para fine-tuning 🔥 Sí – perfecto para modelos VQA o CLIP médicos
🌍Diversidad cultural 🌍 Limitada – contenido basado en manuales clásicos en inglés

‍

‍

🧠 Recomendado para

  • Investigadores de visión médica
  • programadores VQA
  • Proyectos de salud con IA

‍

‍

🔧 Herramientas compatibles

  • PyTorch
  • OpenVQA
  • BLIP
  • LLaVA
  • Hugging Face Transformers

‍

‍

💡 Consejo

Filtra las preguntas por tipo (binarias o abiertas) para crear subtareas específicas durante el entrenamiento.

Preguntas frecuentes

¿Se puede utilizar este conjunto de datos con fines clínicos?

No, está diseñado para la investigación de la IA y no debe usarse directamente con fines de diagnóstico sin validación médica.

¿Se utilizan todas las imágenes en pares de control de calidad?

No, solo 4.289 imágenes de las 5.004 están realmente asociadas a preguntas.

¿Este conjunto de datos es multilingüe?

No, todas las preguntas y respuestas están escritas en inglés. Se podría considerar una versión multilingüe con traducción.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.