Symptom to Diagnosis
Un conjunto de datos textuales centrado en el reconocimiento de diagnósticos a partir de descripciones de síntomas en lenguaje natural, útil para la clasificación médica supervisada.
1.065 ejemplos en JSONL, campos de entrada/salida en inglés, divididos en entrenamiento/prueba
Apache 2.0
Descripción
El conjunto de datos Symptom to Diagnosis contiene 1.065 pares de «síntomas → diagnóstico», escritos en inglés natural que simulan las descripciones de los pacientes. Los textos se generaron o limpiaron mediante un LLM para lograr una mayor coherencia lingüística. Cada entrada tiene un campo texto_entrada (síntomas) y texto_salida (diagnóstico).
¿Para qué sirve este conjunto de datos?
- Forme un modelo supervisado de clasificación de textos médicos (síntoma → diagnóstico)
- Creación de sistemas de apoyo a la toma de decisiones para la medicina general
- Analice el lenguaje utilizado por los pacientes al describir las afecciones médicas
¿Se puede enriquecer o mejorar?
Sí. Es posible añadir variantes lingüísticas, traducciones multilingües o anotar los casos según la gravedad o la cronología de los síntomas. El etiquetado también se puede refinar según las subcategorías clínicas.
🔎 En resumen
🧠 Recomendado para
- Proyectos de clasificación de PNL médica
- Asistentes de triaje
- Formación de estudiantes de IA para la salud
🔧 Herramientas compatibles
- Scikit-learn
- Hugging Face Transformers
- FastText
- SpaCy
💡 Consejo
Para mayor solidez, añada paráfrasis y sinónimos en las descripciones sintomáticas.
Preguntas frecuentes
¿Se puede usar este conjunto de datos para entrenar un modelo de diagnóstico médico automatizado?
Sí, ese es precisamente su objetivo. Permite entrenar un modelo de PNL para hacer coincidir los síntomas textuales con un diagnóstico probable.
¿Este conjunto de datos es adecuado para el uso multilingüe?
Actualmente solo está en inglés. Sin embargo, se puede traducir y enriquecer para cubrir otros idiomas o contextos clínicos.
¿Cuál es la granularidad de los diagnósticos de este conjunto de datos?
El conjunto de datos cubre 22 diagnósticos comunes, cada uno representado por cuarenta ejemplos, lo que permite un aprendizaje equilibrado y específico.




