Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Symptom to Diagnosis
Texto

Symptom to Diagnosis

Un conjunto de datos textuales centrado en el reconocimiento de diagnósticos a partir de descripciones de síntomas en lenguaje natural, útil para la clasificación médica supervisada.

Obtén el dataset
Tamaño

1.065 ejemplos en JSONL, campos de entrada/salida en inglés, divididos en entrenamiento/prueba

Licencia

Apache 2.0

Descripción

El conjunto de datos Symptom to Diagnosis contiene 1.065 pares de «síntomas → diagnóstico», escritos en inglés natural que simulan las descripciones de los pacientes. Los textos se generaron o limpiaron mediante un LLM para lograr una mayor coherencia lingüística. Cada entrada tiene un campo texto_entrada (síntomas) y texto_salida (diagnóstico).

¿Para qué sirve este conjunto de datos?

  • Forme un modelo supervisado de clasificación de textos médicos (síntoma → diagnóstico)
  • Creación de sistemas de apoyo a la toma de decisiones para la medicina general
  • Analice el lenguaje utilizado por los pacientes al describir las afecciones médicas

¿Se puede enriquecer o mejorar?

Sí. Es posible añadir variantes lingüísticas, traducciones multilingües o anotar los casos según la gravedad o la cronología de los síntomas. El etiquetado también se puede refinar según las subcategorías clínicas.

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐⭐☆ (formato simple y estructurado)
🧼Necesidad de limpieza ⭐⭐⭐⭐⭐ (ninguna, contenido ya limpio y revisado)
🏷️Riqueza de las anotaciones ⭐⭐⭐☆☆ (adecuada – 22 diagnósticos bien distribuidos)
📜Licencia comercial ✅ Sí (Apache 2.0)
👨‍💻Ideal para principiantes 👨‍⚕️ Sí – buena base de entrenamiento en NLP médico
🔁Reutilizable para fine-tuning 🔥 Muy bueno para modelos de clasificación médica
🌍Diversidad cultural 🌐 Limitada – solo en inglés y cultura occidental

🧠 Recomendado para

  • Proyectos de clasificación de PNL médica
  • Asistentes de triaje
  • Formación de estudiantes de IA para la salud

🔧 Herramientas compatibles

  • Scikit-learn
  • Hugging Face Transformers
  • FastText
  • SpaCy

💡 Consejo

Para mayor solidez, añada paráfrasis y sinónimos en las descripciones sintomáticas.

Preguntas frecuentes

¿Se puede usar este conjunto de datos para entrenar un modelo de diagnóstico médico automatizado?

Sí, ese es precisamente su objetivo. Permite entrenar un modelo de PNL para hacer coincidir los síntomas textuales con un diagnóstico probable.

¿Este conjunto de datos es adecuado para el uso multilingüe?

Actualmente solo está en inglés. Sin embargo, se puede traducir y enriquecer para cubrir otros idiomas o contextos clínicos.

¿Cuál es la granularidad de los diagnósticos de este conjunto de datos?

El conjunto de datos cubre 22 diagnósticos comunes, cada uno representado por cuarenta ejemplos, lo que permite un aprendizaje equilibrado y específico.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.