Mostly Basic Python Problems (MBPP)
Un conjunto de datos de problemas sencillos de Python para entrenar y evaluar modelos de generación de código. Cada problema contiene una descripción, una solución en código Python y pruebas automatizadas. Útil para la síntesis de programas y el aprendizaje automático aplicado al código.
Aproximadamente 1000 problemas de Python, formato JSON, incluida la descripción, el código fuente y las pruebas automatizadas
CC-BY 4.0
Descripción
El conjunto de datos Mostly Basic Python Problems (MBPP) incluye aproximadamente 1000 problemas de programación en Python. Cada problema contiene una descripción textual, una solución en código Python y tres casos de prueba automatizados. Este conjunto de datos se usa principalmente para entrenar y evaluar modelos de generación de código, especialmente en el contexto de la síntesis de programas con modelos de lenguaje.
¿Para qué sirve este conjunto de datos?
- Entrene modelos para la generación automática de código Python
- Evaluar el desempeño de los modelos en la síntesis de los programas básicos
- Apoyo a la investigación de programación asistida por IA
¿Se puede enriquecer o mejorar?
Sí, es posible añadir problemas más complejos, anotar dificultades o enriquecer el conjunto de datos con ejemplos multilingües. La integración de pruebas adicionales o la diversificación de los casos de uso también pueden mejorar su relevancia.
🔎 En resumen
🧠 Recomendado para
- Investigadores de IA
- programadores de PNL
- Proyectos de síntesis de código
🔧 Herramientas compatibles
- Hugging Face Transformers
- OpenAI Codex
- LangChain
💡 Consejo
Utilice este conjunto de datos para comenzar a realizar ajustes antes de pasar a conjuntos de datos más grandes y complejos.
Preguntas frecuentes
¿Este conjunto de datos es adecuado para entrenar modelos generativos multilingües?
No, el conjunto de datos solo está en inglés con código Python, no cubre otros idiomas.
¿Se puede usar este conjunto de datos para evaluar un modelo en problemas complejos?
Este conjunto de datos cubre principalmente problemas básicos. Para problemas complejos, se recomiendan otros conjuntos de datos más grandes.
¿El conjunto de datos contiene ejemplos de código que se prueban automáticamente?
Sí, cada problema va acompañado de tres pruebas automatizadas para verificar la validez del código.




