Tachibana 2 – Raisonnement de code avec DeepSeek R1
Corpus de prompts complexes pour évaluer les capacités de raisonnement en programmation du modèle DeepSeek R1 (685B).
27 261 paires prompt-réponse, 203 Mo (Parquet), texte structuré
Apache 2.0
Description
Tachibana2-DeepSeek-R1 est un corpus de plus de 27 000 prompts générés de manière synthétique pour tester les compétences de raisonnement en programmation du modèle DeepSeek R1. Les prompts proviennent d’une variante enrichie du dataset Tachibana original, et les réponses sont produites automatiquement par le modèle R1 sans filtrage humain. Le but est d’évaluer la qualité, la cohérence et la logique des réponses générées par un LLM spécialisé en code.
À quoi sert ce dataset ?
- Évaluer la capacité d’un LLM à raisonner autour de la logique de programmation
- Tester la robustesse et les erreurs possibles générées par des modèles de très grande taille
- Créer des benchmarks ou affiner des modèles spécialisés en assistant de codage
Peut-on l’enrichir ou l’améliorer ?
Oui. Bien que ce dataset soit fourni “tel quel”, il peut être enrichi par des annotations humaines (validation, correction, classification d’erreur). Il peut également servir de base pour un filtrage plus strict ou un pré-traitement ciblé avant fine-tuning. Un système de scoring automatique des réponses pourrait aussi être intégré.
🔎 En résumé
🧠 Recommandé pour
- Développeurs de LLMs spécialisés
- Chercheurs en IA de raisonnement
- Projets de tutorat IA en programmation
🔧 Outils compatibles
- VLLM
- Code Llama
- DeepSeek
- Hugging Face Transformers
- LangChain
💡 Astuce
Pour tirer parti du dataset, filtrez les exemples avec des boucles infinies ou des sorties incohérentes avant de lancer un fine-tuning.
Questions fréquemment posées
Ce dataset est-il adapté pour l’évaluation de LLMs généralistes ?
Oui, mais il est surtout pertinent pour tester la compétence spécifique en raisonnement de code.
Les réponses sont-elles validées manuellement ?
Non, les sorties du modèle R1 sont fournies telles quelles, sans correction ni annotation.
Peut-on l’utiliser pour l’entraînement supervisé ?
Oui, mais un pré-traitement est recommandé pour filtrer les réponses incorrectes ou aberrantes.




