En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Tachibana 2 – Raisonnement de code avec DeepSeek R1
Texte

Tachibana 2 – Raisonnement de code avec DeepSeek R1

Corpus de prompts complexes pour évaluer les capacités de raisonnement en programmation du modèle DeepSeek R1 (685B).

Télécharger le dataset
Taille

27 261 paires prompt-réponse, 203 Mo (Parquet), texte structuré

Licence

Apache 2.0

Description

Tachibana2-DeepSeek-R1 est un corpus de plus de 27 000 prompts générés de manière synthétique pour tester les compétences de raisonnement en programmation du modèle DeepSeek R1. Les prompts proviennent d’une variante enrichie du dataset Tachibana original, et les réponses sont produites automatiquement par le modèle R1 sans filtrage humain. Le but est d’évaluer la qualité, la cohérence et la logique des réponses générées par un LLM spécialisé en code.

À quoi sert ce dataset ?

  • Évaluer la capacité d’un LLM à raisonner autour de la logique de programmation
  • Tester la robustesse et les erreurs possibles générées par des modèles de très grande taille
  • Créer des benchmarks ou affiner des modèles spécialisés en assistant de codage

Peut-on l’enrichir ou l’améliorer ?

Oui. Bien que ce dataset soit fourni “tel quel”, il peut être enrichi par des annotations humaines (validation, correction, classification d’erreur). Il peut également servir de base pour un filtrage plus strict ou un pré-traitement ciblé avant fine-tuning. Un système de scoring automatique des réponses pourrait aussi être intégré.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Moyenne – nécessite parfois du filtrage manuel)
🧼 Besoin de nettoyage⭐⭐✩✩✩ (Oui – les réponses n’ont pas été revues ni corrigées)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Moyenne – prompt + réponse uniquement, sans métadonnées d’évaluation)
📜 Licence commerciale✅ Oui (Apache 2.0)
👨‍💻 Idéal pour les débutants⚠️ Moyennement – nécessite compréhension du code
🔁 Réutilisable en fine-tuning🎯 Oui, idéal pour modèles de génération de code
🌍 Diversité culturelle⚠️ Limité – corpus axé sur l'anglais technique

🧠 Recommandé pour

  • Développeurs de LLMs spécialisés
  • Chercheurs en IA de raisonnement
  • Projets de tutorat IA en programmation

🔧 Outils compatibles

  • VLLM
  • Code Llama
  • DeepSeek
  • Hugging Face Transformers
  • LangChain

💡 Astuce

Pour tirer parti du dataset, filtrez les exemples avec des boucles infinies ou des sorties incohérentes avant de lancer un fine-tuning.

Questions fréquemment posées

Ce dataset est-il adapté pour l’évaluation de LLMs généralistes ?

Oui, mais il est surtout pertinent pour tester la compétence spécifique en raisonnement de code.

Les réponses sont-elles validées manuellement ?

Non, les sorties du modèle R1 sont fournies telles quelles, sans correction ni annotation.

Peut-on l’utiliser pour l’entraînement supervisé ?

Oui, mais un pré-traitement est recommandé pour filtrer les réponses incorrectes ou aberrantes.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.