En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
CoTton 67k
Texte

CoTton 67k

Corpus de dialogues assistant/utilisateur structurés selon le format ShareGPT, mettant en valeur des raisonnements détaillés étape par étape (Chain-of-Thought).

Télécharger le dataset
Taille

67 844 exemples, 813 Mo, format JSON/ShareGPT

Licence

Apache 2.0

Description

CoTton-67k est un dataset conversationnel spécialisé dans le raisonnement en langage naturel. Il contient 67 844 exemples d’échanges utilisateur-modèle au format ShareGPT. Chaque exemple met en scène un raisonnement explicite en plusieurs étapes (Chain-of-Thought), avec une grande diversité de tâches (générales, STEM, conditionnelles). Les données sont dérivées de modèles open-source (Qwen, DeepSeek, QwQ, etc.) et ont été nettoyées pour garantir une structure claire et cohérente.

À quoi sert ce dataset ?

  • Entraîner des LLMs à expliciter leur raisonnement étape par étape
  • Améliorer la qualité des réponses sur des tâches complexes (math, code, science)
  • Tester ou évaluer les capacités d’inférence des modèles dans des contextes ouverts

Peut-on l’enrichir ou l’améliorer ?

Oui, ce dataset peut être enrichi en ajoutant des variantes de réponses, en traduisant les échanges dans d'autres langues, ou en ajoutant une annotation des types de raisonnements. Il peut aussi être combiné à des datasets spécialisés comme OpenCodeReasoning pour un entraînement multimodal ou orienté programmation.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Très simple à exploiter - format ShareGPT)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Déjà nettoyé et structuré)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Raisonnement complet et structuré par tour)
📜 Licence commerciale✅ Oui (Apache 2.0)
👨‍💻 Idéal pour les débutants🌟 Oui, facilement exploitable pour fine-tuning
🔁 Réutilisable en fine-tuning🎯 Idéal pour renforcer le raisonnement CoT
🌍 Diversité culturelle⚠️ Modérée – contenu générique orienté STEM

🧠 Recommandé pour

  • Formateurs LLM
  • Chercheurs en NLP
  • Projets éducatifs IA

🔧 Outils compatibles

  • LoRA
  • OpenChat
  • Hugging Face Transformers
  • VLLM

💡 Astuce

Combinez ce dataset avec vos propres cas réels pour affiner les raisonnements selon un domaine cible.

Questions fréquemment posées

Le dataset est-il multilingue ?

Non, il est uniquement en anglais pour le moment. Il est toutefois possible de le traduire pour un usage multilingue.

Les dialogues suivent-ils tous le même schéma ?

Oui, chaque exemple suit un format user/assistant, centré sur une question et un raisonnement complet étape par étape.

Est-il adapté pour un modèle de taille moyenne (7B ou moins) ?

Oui, le dataset est utilisé notamment pour entraîner ou affiner des modèles de 7B et fonctionne très bien pour cette échelle.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.