CoTton 67k
Conjunto de diálogos entre asistentes y usuarios estructurados según el formato ShareGpt, destacando el razonamiento detallado paso a paso (Chain-of-Thought).
Descripción
CoTton 67k es un conjunto de datos conversacionales especializado en el razonamiento en lenguaje natural. Contiene 67 844 ejemplos de intercambios de modelos de usuario en formato ShareGPT. Cada ejemplo implica un razonamiento explícito en varios pasos (Chain-of-Thought), con una gran diversidad de tareas (generales, STEM, condicionales). Los datos se derivan de modelos de código abierto (Qwen, DeepSeek, QwQ, etc.) y se han limpiado para garantizar una estructura clara y coherente.
¿Para qué sirve este conjunto de datos?
- Capacite a los LLM para que expliquen su razonamiento paso a paso
- Mejorar la calidad de las respuestas en tareas complejas (matemáticas, código, ciencias)
- Probar o evaluar las capacidades de inferencia de modelos en contextos abiertos
¿Se puede enriquecer o mejorar?
Sí, este conjunto de datos se puede enriquecer añadiendo variantes de respuestas, traduciendo los intercambios a otros idiomas o añadiendo una anotación de los tipos de razonamiento. También se puede combinar con conjuntos de datos especializados, como OpenCodeReasoning, para una formación multimodal o orientada a la programación.
🔎 En resumen
🧠 Recomendado para
- Formadores de LLM
- Investigadores de PNL
- Proyectos educativos de IA
🔧 Herramientas compatibles
- LoRA
- OpenChat
- Hugging Face Transformers
- VLLM
💡 Consejo
Combine este conjunto de datos con sus propios casos reales para refinar el razonamiento de acuerdo con el dominio de destino.
Preguntas frecuentes
¿El conjunto de datos es multilingüe?
No, por el momento solo está en inglés. Sin embargo, es posible traducirlo para uso multilingüe.
¿Todos los diálogos siguen el mismo patrón?
Sí, cada ejemplo sigue un formato de usuario/asistente, centrado en una pregunta y en un razonamiento exhaustivo paso a paso.
¿Es adecuado para un modelo de tamaño mediano (7B o menos)?
Sí, el conjunto de datos se usa en particular para entrenar o refinar modelos 7B y funciona muy bien para esta escala.




