Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Mostly Basic Python Problems (MBPP)
Texto

Mostly Basic Python Problems (MBPP)

Un conjunto de datos de problemas sencillos de Python para entrenar y evaluar modelos de generación de código. Cada problema contiene una descripción, una solución en código Python y pruebas automatizadas. Útil para la síntesis de programas y el aprendizaje automático aplicado al código.

Obtén el dataset
Tamaño

Aproximadamente 1000 problemas de Python, formato JSON, incluida la descripción, el código fuente y las pruebas automatizadas

Licencia

CC-BY 4.0

Descripción

El conjunto de datos Mostly Basic Python Problems (MBPP) incluye aproximadamente 1000 problemas de programación en Python. Cada problema contiene una descripción textual, una solución en código Python y tres casos de prueba automatizados. Este conjunto de datos se usa principalmente para entrenar y evaluar modelos de generación de código, especialmente en el contexto de la síntesis de programas con modelos de lenguaje.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos para la generación automática de código Python
  • Evaluar el desempeño de los modelos en la síntesis de los programas básicos
  • Apoyo a la investigación de programación asistida por IA

¿Se puede enriquecer o mejorar?

Sí, es posible añadir problemas más complejos, anotar dificultades o enriquecer el conjunto de datos con ejemplos multilingües. La integración de pruebas adicionales o la diversificación de los casos de uso también pueden mejorar su relevancia.

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐⭐☆ (formato JSON claro, fácil de manejar)
🧼Necesidad de limpieza ⭐☆☆☆☆ (datos ya validados y probados)
🏷️Riqueza de las anotaciones ⭐⭐☆☆☆ (básico: descripción, solución, pruebas)
📜Licencia comercial ✅ Libre para uso comercial (CC-BY 4.0)
👨‍💻Ideal para principiantes ⚠️ Adecuado para iniciación en generación de código
🔁Reutilizable en fine-tuning 🔥 Eficaz para fine-tuning en tareas de generación de código
🌍Diversidad cultural 🌐 Limitada – Contenido en inglés y código Python únicamente

🧠 Recomendado para

  • Investigadores de IA
  • programadores de PNL
  • Proyectos de síntesis de código

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • OpenAI Codex
  • LangChain

💡 Consejo

Utilice este conjunto de datos para comenzar a realizar ajustes antes de pasar a conjuntos de datos más grandes y complejos.

Preguntas frecuentes

¿Este conjunto de datos es adecuado para entrenar modelos generativos multilingües?

No, el conjunto de datos solo está en inglés con código Python, no cubre otros idiomas.

¿Se puede usar este conjunto de datos para evaluar un modelo en problemas complejos?

Este conjunto de datos cubre principalmente problemas básicos. Para problemas complejos, se recomiendan otros conjuntos de datos más grandes.

¿El conjunto de datos contiene ejemplos de código que se prueban automáticamente?

Sí, cada problema va acompañado de tres pruebas automatizadas para verificar la validez del código.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.