En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Texte

SNLI

Le dataset SNLI propose 570 000 paires de phrases en anglais annotées manuellement pour la classification en entailment, contradiction ou neutral, essentielle à l’inférence textuelle en NLP.

Télécharger le dataset
Taille

570 000 paires phrase-premise/hypothèse, format JSON

Licence

CC-BY-SA 4.0

Description

‍

SNLI est un corpus majeur pour la tâche de Natural Language Inference (NLI). Chaque exemple contient une phrase "premise" et une phrase "hypothesis" annotées avec un label indiquant si la deuxième implique la première, la contredit, ou est neutre.

‍

‍

À quoi sert ce dataset ?

‍

  • Entraîner et évaluer des modèles d’inférence textuelle
  • Améliorer la compréhension sémantique dans les systèmes NLP
  • Tester la capacité des modèles à raisonner sur des relations logiques entre phrases

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, en ajoutant des exemples dans d’autres langues, en enrichissant les annotations ou en intégrant des explications des décisions pour un apprentissage plus transparent.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Format simple et largement supporté)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Très faible, données prêtes à l’emploi)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne, avec trois labels équilibrés)
📜 Licence commerciale✅ Oui (CC-BY-SA 4.0)
👨‍💻 Idéal pour les débutants🌟 Oui, souvent utilisé comme dataset de référence
🔁 Réutilisable en fine-tuning🎯 Parfait pour fine-tuning sur tâches de compréhension textuelle
🌍 Diversité culturelle⚡ Anglais, textes issus d’utilisateurs de Flickr et Amazon Mechanical Turk

‍

‍

🧠 Recommandé pour

  • Chercheurs en NLP
  • Développeurs d’IA
  • Étudiants en apprentissage profond

‍

‍

🔧 Outils compatibles

  • Hugging Face Transformers
  • PyTorch
  • TensorFlow
  • AllenNLP

‍

‍

💡 Astuce

Utiliser SNLI conjointement avec d’autres datasets NLI pour améliorer la robustesse des modèles.

Questions fréquemment posées

Quel type d’annotations contient le dataset SNLI ?

Des labels manuels indiquant si la deuxième phrase implique, contredit ou est neutre par rapport à la première.

Le dataset est-il adapté à un usage commercial ?

Oui, la licence CC-BY-SA 4.0 permet un usage commercial sous condition de partage à l’identique.

Quelle est la taille moyenne des phrases dans SNLI ?

En moyenne, la phrase "premise" contient 14,1 tokens et la "hypothesis" 8,3 tokens.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.