En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
OpenCodeReasoning
Texte

OpenCodeReasoning

Dataset de grande taille contenant des questions de programmation compétitive en Python, avec solutions codées, destiné au fine-tuning de modèles.

Télécharger le dataset
Taille

735 255 exemples en texte structuré JSON, code source Python, questions et solutions

Licence

Creative Commons Attribution 4.0 International (CC BY 4.0)

Description

Le dataset OpenCodeReasoning regroupe plus de 735 000 exemples basés sur 28 319 questions uniques de programmation compétitive en Python. Chaque exemple contient la question, la solution générée, et des métadonnées associées.

À quoi sert ce dataset ?

  • Entraîner et évaluer des modèles de raisonnement pour la génération automatique de code
  • Améliorer les performances des LLMs sur des problèmes de programmation complexes
  • Supporter le fine-tuning supervisé (SFT) pour des applications en développement logiciel automatisé

Peut-on l’enrichir ou l’améliorer ?

Oui, on peut ajouter des annotations supplémentaires sur la complexité, ou intégrer des tests automatiques d’exécution. Le dataset peut être complété par d’autres sources de questions ou langues.

🔎 En résumé

Critère Évaluation
🧩Facilité d’utilisation ⭐⭐⭐⭐☆ (format JSON clair, nécessite des connaissances en code et NLP)
🧼Besoin de nettoyage ⭐⭐⭐⭐☆ (faible : données bien structurées et annotées)
🏷️Richesse des annotations ⭐⭐⭐⭐☆ (code, question, solution, métadonnées diverses)
📜Licence commerciale ✅ Oui (CC-BY 4.0)
👨‍💻Idéal pour les débutants 👨‍🎓 Moyennement – utile pour utilisateurs avec bases en NLP/code
🔁Réutilisable en fine-tuning 🔥 Parfait pour fine-tuning sur génération de code et raisonnement algorithmique
🌍Diversité culturelle 🌐 Multisource, focalisé sur la programmation compétitive internationale

🧠 Recommandé pour

  • Chercheurs en NLP
  • Développeurs de modèles de génération de code
  • Équipes AI software

🔧 Outils compatibles

  • Hugging Face Datasets
  • PyTorch
  • TensorFlow
  • Outils de parsing de code Python

💡 Astuce

Intégrer des tests unitaires pour valider les solutions générées lors de l’entraînement.

Questions fréquemment posées

Quelles plateformes de programmation compétitive sont couvertes par ce dataset ?

CodeForces, AtCoder, CodeChef, HackerRank, LeetCode, entre autres, avec plus de 28 000 questions uniques collectées.

Ce dataset est-il adapté pour un usage commercial ?

Oui, la licence CC-BY 4.0 autorise l’usage commercial sous attribution.

Peut-on utiliser ce dataset pour entraîner des modèles dans d’autres langages de programmation ?

Ce dataset est focalisé sur Python, mais la méthodologie peut être adaptée pour d’autres langages via collecte et annotation supplémentaires.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.