Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Reasoning V1 20M
Texto

Reasoning V1 20M

Conjunto de datos sintético masivo de preguntas y respuestas con trazas de razonamiento textual sobre varios temas no matemáticos, destinado a entrenar a los modelos para que razonen.

Obtén el dataset
Tamaño

Más de 22 millones de filas, 35.800 millones de fichas, formato JSON/Parquet

Licencia

Apache 2.0

Descripción

Reasoning V1 20M es un gigantesco conjunto de datos sintéticos que comprende más de 22 millones de preguntas y respuestas acompañadas de rastros de razonamiento. Estos ejemplos abarcan una amplia variedad de campos, como las ciencias sociales, las ciencias naturales, la educación, la escritura creativa o las conversaciones generales. El formato incluye una sección de razonamiento rodeada de etiquetas <think>antes de la respuesta final.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos lingüísticos para replicar habilidades de razonamiento complejas y diversas
  • Mejora del rendimiento de los modelos más pequeños mediante un ajuste fino supervisado (SFT) con trazas explícitas
  • Evalúe la capacidad de los modelos para seguir el razonamiento paso a paso sobre una variedad de temas

¿Se puede enriquecer o mejorar?

Sí, aunque no se comprueba la precisión de los rastros y las respuestas, es posible añadir una validación humana o automática. También puedes anotar la calidad del razonamiento o añadir correcciones para mejorar la calidad del conjunto de datos.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Formato voluminoso pero estándar, requiere recursos)
🧼 Necesidad de limpieza⭐⭐⭐⭐✩ (Moderado: sin validación de calidad de respuestas)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Rastros de razonamiento presentes pero no validados)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes⚠️ No, requiere buenos recursos y expertise
🔁 Reutilizable para fine-tuning🎯 Excelente para fine-tuning en razonamiento supervisado
🌍 Diversidad cultural⚠️ Mayormente en inglés, alta diversidad temática

🧠 Recomendado para

  • Investigadores avanzados de PNL
  • Desarrolladores de modelos de razonamiento
  • Proyectos de IA explicables

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • PyTorch Lightning
  • DeepSpeed
  • LoRA

💡 Consejo

Valide o filtre los ejemplos para mejorar la calidad del ajuste fino.

Preguntas frecuentes

¿Se ha comprobado completamente este conjunto de datos para comprobar la precisión de las respuestas?

No, las respuestas y las líneas de razonamiento no están verificadas y pueden contener errores.

¿Cuál es el tamaño aproximado del conjunto de datos?

Más de 22 millones de ejemplares con alrededor de 35.800 millones de fichas.

¿Se puede usar este conjunto de datos para entrenar modelos más pequeños?

Sí, está especialmente diseñado para ajustar modelos más pequeños con supervisión del razonamiento.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.