En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Symptom to Diagnosis
Texte

Symptom to Diagnosis

Jeu de données textuel centré sur la reconnaissance des diagnostics à partir de descriptions de symptômes en langage naturel, utile pour la classification médicale supervisée.

Télécharger le dataset
Taille

1 065 exemples en JSONL, champs input/output en anglais, répartis en train/test

Licence

Apache 2.0

Description

Le dataset Symptom to Diagnosis contient 1 065 paires "symptômes → diagnostic", rédigées en anglais naturel simulant des descriptions patient. Les textes ont été générés ou nettoyés à l’aide d’un LLM pour plus de cohérence linguistique. Chaque entrée comporte un champ input_text (symptômes) et output_text (diagnostic).

À quoi sert ce dataset ?

  • Former un modèle de classification de texte médical supervisée (symptôme → diagnostic)
  • Créer des systèmes d’aide à la décision pour la médecine générale
  • Analyser le langage utilisé par les patients dans la description de troubles médicaux

Peut-on l’enrichir ou l’améliorer ?

Oui. Il est possible d’ajouter des variantes linguistiques, traductions multilingues ou d’annoter les cas par degré de gravité ou chronologie des symptômes. L’étiquetage peut aussi être affiné selon des sous-catégories cliniques.

🔎 En résumé

Critère Évaluation
🧩Facilité d’utilisation ⭐⭐⭐⭐☆ (format simple et structuré)
🧼Besoin de nettoyage ⭐⭐⭐⭐⭐ (aucun, contenu déjà nettoyé et relu)
🏷️Richesse des annotations ⭐⭐⭐☆☆ (correcte – 22 diagnostics bien répartis)
📜Licence commerciale ✅ Oui (Apache 2.0)
👨‍💻Idéal pour les débutants 👨‍⚕️ Oui – bonne base d’entraînement en NLP médical
🔁Réutilisable en fine-tuning 🔥 Très bon pour modèle de classification médicale
🌍Diversité culturelle 🌐 Limitée – uniquement en anglais et culture occidentale

🧠 Recommandé pour

  • Projets de classification NLP médicale
  • Assistants de triage
  • Formation d’étudiants en IA santé

🔧 Outils compatibles

  • Scikit-learn
  • Hugging Face Transformers
  • FastText
  • SpaCy

💡 Astuce

Pour une meilleure robustesse, ajoutez des paraphrases et synonymes dans les descriptions symptomatiques.

Questions fréquemment posées

Ce dataset peut-il servir à entraîner un modèle de diagnostic médical automatisé ?

Oui, c’est précisément son objectif. Il permet d’entraîner un modèle NLP à faire correspondre des symptômes textuels à un diagnostic probable.

Ce dataset est-il adapté à un usage multilingue ?

Actuellement, il est uniquement en anglais. Il peut toutefois être traduit et enrichi pour couvrir d’autres langues ou contextes cliniques.

Quelle est la granularité des diagnostics présents dans ce dataset ?

Le dataset couvre 22 diagnostics courants, chacun représenté par une quarantaine d’exemples, ce qui permet un apprentissage équilibré et ciblé.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.