Symptom to Diagnosis
Jeu de données textuel centré sur la reconnaissance des diagnostics à partir de descriptions de symptômes en langage naturel, utile pour la classification médicale supervisée.
1 065 exemples en JSONL, champs input/output en anglais, répartis en train/test
Apache 2.0
Description
Le dataset Symptom to Diagnosis contient 1 065 paires "symptômes → diagnostic", rédigées en anglais naturel simulant des descriptions patient. Les textes ont été générés ou nettoyés à l’aide d’un LLM pour plus de cohérence linguistique. Chaque entrée comporte un champ input_text (symptômes) et output_text (diagnostic).
À quoi sert ce dataset ?
- Former un modèle de classification de texte médical supervisée (symptôme → diagnostic)
- Créer des systèmes d’aide à la décision pour la médecine générale
- Analyser le langage utilisé par les patients dans la description de troubles médicaux
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible d’ajouter des variantes linguistiques, traductions multilingues ou d’annoter les cas par degré de gravité ou chronologie des symptômes. L’étiquetage peut aussi être affiné selon des sous-catégories cliniques.
🔎 En résumé
🧠 Recommandé pour
- Projets de classification NLP médicale
- Assistants de triage
- Formation d’étudiants en IA santé
🔧 Outils compatibles
- Scikit-learn
- Hugging Face Transformers
- FastText
- SpaCy
💡 Astuce
Pour une meilleure robustesse, ajoutez des paraphrases et synonymes dans les descriptions symptomatiques.
Questions fréquemment posées
Ce dataset peut-il servir à entraîner un modèle de diagnostic médical automatisé ?
Oui, c’est précisément son objectif. Il permet d’entraîner un modèle NLP à faire correspondre des symptômes textuels à un diagnostic probable.
Ce dataset est-il adapté à un usage multilingue ?
Actuellement, il est uniquement en anglais. Il peut toutefois être traduit et enrichi pour couvrir d’autres langues ou contextes cliniques.
Quelle est la granularité des diagnostics présents dans ce dataset ?
Le dataset couvre 22 diagnostics courants, chacun représenté par une quarantaine d’exemples, ce qui permet un apprentissage équilibré et ciblé.




