Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
OpenCodeReasoning
Texto

OpenCodeReasoning

Gran conjunto de datos que contiene preguntas de programación competitivas en Python, con soluciones codificadas, destinadas a ajustar los modelos.

Obtén el dataset
Tamaño

735.255 ejemplos en texto estructurado JSON, código fuente de Python, preguntas y soluciones

Licencia

Creative Commons Atribución 4.0 Internacional (CC BY 4.0)

Descripción

El conjunto de datos OpenCodeReasoning contiene más de 735.000 ejemplos basados en 28.319 preguntas de programación competitivas únicas en Python. Cada ejemplo contiene la pregunta, la solución generada y los metadatos asociados.

¿Para qué sirve este conjunto de datos?

  • Entrene y evalúe modelos de razonamiento para la generación automática de código
  • Mejorar el rendimiento de los LLM en problemas de programación complejos
  • Soporta el ajuste fino supervisado (SFT) para aplicaciones de desarrollo de software automatizadas

¿Se puede enriquecer o mejorar?

Sí, puede agregar anotaciones de complejidad adicionales o integrar pruebas de ejecución automáticas. El conjunto de datos se puede complementar con otras fuentes de preguntas o idiomas.

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐⭐☆ (formato JSON claro, requiere conocimientos de programación y NLP)
🧼Limpieza necesaria ⭐⭐⭐⭐☆ (baja: datos bien estructurados y anotados)
🏷️Riqueza de anotaciones ⭐⭐⭐⭐☆ (código, pregunta, solución, metadatos diversos)
📜Licencia comercial ✅ Sí (CC-BY 4.0)
👨‍💻Ideal para principiantes ⚠️ Moderado – útil para usuarios con conocimientos básicos de NLP/programación
🔁Reutilizable para fine-tuning 🔥 Perfecto para fine-tuning en generación de código y razonamiento algorítmico
🌍Diversidad cultural 🌐 Multifuente, enfocado en programación competitiva internacional

🧠 Recomendado para

  • Investigadores de PNL
  • Desarrolladores de modelos de generación de código
  • Equipos de software de IA

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • PyTorch
  • TensorFlow
  • Herramientas de parsing de código Python

💡 Consejo

Integre las pruebas unitarias para validar las soluciones generadas durante la capacitación.

Preguntas frecuentes

¿Qué plataformas de programación competitivas cubre este conjunto de datos?

CodeForces, ATCoder, CodeChef, CodeChef, HackerRank, LeetCode, entre otros, con más de 28.000 preguntas únicas recopiladas.

¿Este conjunto de datos es adecuado para uso comercial?

Sí, la licencia CC-BY 4.0 permite el uso comercial bajo atribución.

¿Se puede usar este conjunto de datos para entrenar modelos en otros lenguajes de programación?

Este conjunto de datos se centra en Python, pero la metodología se puede adaptar a otros lenguajes mediante la recopilación y la anotación adicionales.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.