Tachibana 2 — Razonamiento de código con DeepSeek R1
Conjunto de indicaciones complejas para evaluar las habilidades de razonamiento al programar el modelo DeepSeek R1 (685B).
27.261 pares de respuestas rápidas, 203 MB (Parquet), texto estructurado
Apache 2.0
Descripción
Tachibana 2 - DeepSeek-R1 es un corpus de más de 27 000 indicaciones generadas sintéticamente para probar las habilidades de razonamiento de programación del modelo DeepSeek R1. Las solicitudes provienen de una variante enriquecida del conjunto de datos original de Tachibana, y el modelo R1 produce respuestas automáticamente sin filtros humanos. El objetivo es evaluar la calidad, la coherencia y la lógica de las respuestas generadas por un LLM especializado en código.
¿Para qué sirve este conjunto de datos?
- Evaluar la capacidad de un LLM para razonar en torno a la lógica de programación
- Pruebe la robustez y los posibles errores generados por modelos muy grandes
- Cree puntos de referencia o perfeccione modelos especializados con un asistente de codificación
¿Se puede enriquecer o mejorar?
Sí. Aunque este conjunto de datos se proporciona «tal cual», se puede enriquecer con anotaciones humanas (validación, corrección, clasificación de errores). También se puede utilizar como base para un filtrado más estricto o para un preprocesamiento específico antes de realizar ajustes. También se podría integrar un sistema automático de puntuación de respuestas.
🔎 En resumen
🧠 Recomendado para
- Desarrolladores de LLM especializados
- Investigadores de inteligencia artificial razonadora
- Proyectos tutoriales de programación de IA
🔧 Herramientas compatibles
- VLLM
- Code Llama
- DeepSeek
- Hugging Face Transformers
- LangChain
💡 Consejo
Para aprovechar el conjunto de datos, filtra los ejemplos con bucles infinitos o salidas inconsistentes antes de realizar un ajuste fino.
Preguntas frecuentes
¿Este conjunto de datos es adecuado para la evaluación de los LLM generales?
Sí, pero es principalmente relevante para probar habilidades específicas en el razonamiento de código.
¿Las respuestas se validan manualmente?
No, las salidas del modelo R1 se proporcionan tal cual, sin corrección ni anotación.
¿Se puede utilizar para el entrenamiento supervisado?
Sí, pero se recomienda el procesamiento previo para filtrar las respuestas incorrectas o atípicas.




