Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
CoTton 67k
Texto

CoTton 67k

Conjunto de diálogos entre asistentes y usuarios estructurados según el formato ShareGpt, destacando el razonamiento detallado paso a paso (Chain-of-Thought).

Obtén el dataset
Tamaño

67.844 ejemplos, 813 MB, formato JSON/ShareGpt

Licencia

Apache 2.0

Descripción

CoTton 67k es un conjunto de datos conversacionales especializado en el razonamiento en lenguaje natural. Contiene 67 844 ejemplos de intercambios de modelos de usuario en formato ShareGPT. Cada ejemplo implica un razonamiento explícito en varios pasos (Chain-of-Thought), con una gran diversidad de tareas (generales, STEM, condicionales). Los datos se derivan de modelos de código abierto (Qwen, DeepSeek, QwQ, etc.) y se han limpiado para garantizar una estructura clara y coherente.

¿Para qué sirve este conjunto de datos?

  • Capacite a los LLM para que expliquen su razonamiento paso a paso
  • Mejorar la calidad de las respuestas en tareas complejas (matemáticas, código, ciencias)
  • Probar o evaluar las capacidades de inferencia de modelos en contextos abiertos

¿Se puede enriquecer o mejorar?

Sí, este conjunto de datos se puede enriquecer añadiendo variantes de respuestas, traduciendo los intercambios a otros idiomas o añadiendo una anotación de los tipos de razonamiento. También se puede combinar con conjuntos de datos especializados, como OpenCodeReasoning, para una formación multimodal o orientada a la programación.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Muy simple de explotar - formato ShareGPT)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ya limpiado y estructurado)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Razonamiento completo y estructurado por turno)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes🌟 Sí, fácilmente explotable para fine-tuning
🔁 Reutilizable para fine-tuning🎯 Ideal para reforzar razonamiento CoT
🌍 Diversidad cultural⚠️ Moderado – contenido genérico orientado a STEM

🧠 Recomendado para

  • Formadores de LLM
  • Investigadores de PNL
  • Proyectos educativos de IA

🔧 Herramientas compatibles

  • LoRA
  • OpenChat
  • Hugging Face Transformers
  • VLLM

💡 Consejo

Combine este conjunto de datos con sus propios casos reales para refinar el razonamiento de acuerdo con el dominio de destino.

Preguntas frecuentes

¿El conjunto de datos es multilingüe?

No, por el momento solo está en inglés. Sin embargo, es posible traducirlo para uso multilingüe.

¿Todos los diálogos siguen el mismo patrón?

Sí, cada ejemplo sigue un formato de usuario/asistente, centrado en una pregunta y en un razonamiento exhaustivo paso a paso.

¿Es adecuado para un modelo de tamaño mediano (7B o menos)?

Sí, el conjunto de datos se usa en particular para entrenar o refinar modelos 7B y funciona muy bien para esta escala.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.