Mostly Basic Python Problems (MBPP)
Dataset de problèmes Python simples destiné à entraîner et évaluer des modèles de génération de code. Chaque problème contient une description, une solution en code Python, et des tests automatisés. Utile pour la synthèse de programmes et l'apprentissage machine appliqué au code.
Environ 1 000 problèmes Python, format JSON, incluant description, code source et tests automatisés
CC-BY 4.0
Description
Le dataset Mostly Basic Python Problems (MBPP) comprend environ 1 000 problèmes de programmation Python. Chaque problème contient une description textuelle, une solution en code Python, et trois cas de test automatisés. Ce dataset est utilisé principalement pour entraîner et évaluer des modèles de génération de code, notamment dans le contexte de la synthèse de programmes avec des modèles de langage.
À quoi sert ce dataset ?
- Entraîner des modèles de génération automatique de code Python
- Évaluer les performances de modèles dans la synthèse de programmes basiques
- Support pour la recherche en programmation assistée par IA
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible d’ajouter des problèmes plus complexes, d’annoter des difficultés, ou d’enrichir le dataset avec des exemples multilingues. L’intégration de tests supplémentaires ou la diversification des cas d’utilisation peuvent aussi améliorer sa pertinence.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en IA
- Développeurs NLP
- Projets de synthèse de code
🔧 Outils compatibles
- Hugging Face Transformers
- OpenAI Codex
- LangChain
💡 Astuce
Utiliser ce dataset pour démarrer un fine-tuning avant de passer à des datasets plus volumineux et complexes.
Questions fréquemment posées
Ce dataset convient-il pour entraîner des modèles génératifs multilingues ?
Non, le dataset est uniquement en anglais avec du code Python, il ne couvre pas d’autres langues.
Peut-on utiliser ce dataset pour évaluer un modèle sur des problèmes complexes ?
Ce dataset couvre surtout des problèmes basiques. Pour les problèmes complexes, d’autres datasets plus volumineux sont recommandés.
Le dataset contient-il des exemples de code testés automatiquement ?
Oui, chaque problème est accompagné de trois tests automatisés permettant de vérifier la validité du code.




