OpenCodeReasoning
Dataset de grande taille contenant des questions de programmation compétitive en Python, avec solutions codées, destiné au fine-tuning de modèles.
735 255 exemples en texte structuré JSON, code source Python, questions et solutions
Creative Commons Attribution 4.0 International (CC BY 4.0)
Description
Le dataset OpenCodeReasoning regroupe plus de 735 000 exemples basés sur 28 319 questions uniques de programmation compétitive en Python. Chaque exemple contient la question, la solution générée, et des métadonnées associées.
À quoi sert ce dataset ?
- Entraîner et évaluer des modèles de raisonnement pour la génération automatique de code
- Améliorer les performances des LLMs sur des problèmes de programmation complexes
- Supporter le fine-tuning supervisé (SFT) pour des applications en développement logiciel automatisé
Peut-on l’enrichir ou l’améliorer ?
Oui, on peut ajouter des annotations supplémentaires sur la complexité, ou intégrer des tests automatiques d’exécution. Le dataset peut être complété par d’autres sources de questions ou langues.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP
- Développeurs de modèles de génération de code
- Équipes AI software
🔧 Outils compatibles
- Hugging Face Datasets
- PyTorch
- TensorFlow
- Outils de parsing de code Python
💡 Astuce
Intégrer des tests unitaires pour valider les solutions générées lors de l’entraînement.
Questions fréquemment posées
Quelles plateformes de programmation compétitive sont couvertes par ce dataset ?
CodeForces, AtCoder, CodeChef, HackerRank, LeetCode, entre autres, avec plus de 28 000 questions uniques collectées.
Ce dataset est-il adapté pour un usage commercial ?
Oui, la licence CC-BY 4.0 autorise l’usage commercial sous attribution.
Peut-on utiliser ce dataset pour entraîner des modèles dans d’autres langages de programmation ?
Ce dataset est focalisé sur Python, mais la méthodologie peut être adaptée pour d’autres langages via collecte et annotation supplémentaires.




