Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Smoltalk
Texto

Smoltalk

Amplio conjunto de datos textuales sintéticos diseñados para el ajuste detallado y supervisado de los modelos lingüísticos (LLM). Reúna varios subconjuntos que aborden diversas tareas, como la reescritura, el resumen, la racionalización y las restricciones generacionales, así como la codificación y las matemáticas, con el fin de mejorar la calidad de los modelos instructivos.

Obtén el dataset
Tamaño

Aproximadamente 1 millón de ejemplos textuales, divididos en varios subconjuntos especializados (edición, restricciones, restricciones, reescritura, resumen, matemáticas, código...), en formato JSON que se puede utilizar con la biblioteca de conjuntos de datos Hugging Face.

Licencia

Apache 2.0

Descripción

‍

El conjunto de datos Smoltalk es una colección sintética de más de un millón de ejemplos textuales creada para el ajuste supervisado de modelos lingüísticos. Incluye varios subconjuntos especializados en diversas tareas, como la reescritura de textos, el resumen de correos electrónicos y artículos, el cumplimiento de restricciones específicas de generación, así como datos sobre matemáticas y codificación. Estos datos están formateados para facilitar su uso con la biblioteca de conjuntos de datos de Hugging Face y su objetivo es mejorar las habilidades de instrucción y razonamiento de los LLM.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos lingüísticos para seguir mejor instrucciones variadas y complejas
  • Mejore el rendimiento en la reescritura, el resumen, las matemáticas y la programación
  • Probar y fortalecer la comprensión del contexto extenso y las restricciones específicas en la generación de texto

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, este conjunto de datos puede complementarse con anotaciones específicas o adaptarse a otros idiomas. Se pueden agregar ejemplos que apunten a áreas o tipos de instrucciones específicos que no estén cubiertos. Además, los usuarios pueden personalizar los subconjuntos filtrando o combinando los datos según sea necesario para tareas específicas.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐⭐☆ (Bien estructurado, listo para usar con Hugging Face)
🧼Necesidad de limpieza ⭐⭐⭐⭐⭐ (Baja, datos sintéticos cuidadosamente filtrados)
🏷️Riqueza de anotaciones ⭐⭐⭐⭐☆ (Buena diversidad de tareas e instrucciones variadas)
📜Licencia comercial ✅ Sí, Apache 2.0 permisiva
👨‍💻Ideal para principiantes ⚠️ Medio, requiere bases en PLN
🔁Reutilizable en fine-tuning 🔥 Excelente para SFT y entrenamiento con instrucciones
🌍Diversidad cultural 🌐 Mayoritariamente en inglés, diversidad de tareas pero poco multilingüe

‍

‍

🧠 Recomendado para

  • Investigadores de PNL
  • Desarrolladores LLM
  • Proyectos de instrucción de ajuste

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • Transformers
  • PyTorch
  • TensorFlow

‍

‍

💡 Consejo

Utilice subconjuntos específicos para optimizar el entrenamiento de acuerdo con la tarea específica en cuestión.

Preguntas frecuentes

¿Este conjunto de datos es adecuado para los modelos de entrenamiento para comprender textos complejos?

Sí, gracias a sus variados subconjuntos, que incluyen el resumen, la reescritura y el razonamiento, mejora la comprensión del contexto y la generación controlada.

¿Puedo usar este conjunto de datos para entrenar un modelo comercialmente?

Sí, la licencia Apache 2.0 permite el uso comercial sin mayores restricciones.

¿El conjunto de datos contiene ejemplos en varios idiomas?

Principalmente en inglés, no incluye datos multilingües importantes, pero puede ampliarse o complementarse según sea necesario.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.