HQIT: un conjunto masivo de instrucciones de ajuste de LLM
Conjunto de datos muy grande basado en instrucciones diseñado para ajustar los modelos de LLM mediante pares de instrucciones y respuestas de alta calidad.
Aproximadamente 1,9 millones de texto de muestra, formato JSONL
Apache 2.0
Descripción
HQIT es un conjunto de datos masivo compuesto por casi 2 millones de pares de instrucciones y respuestas. Fue diseñado para ajustar los modelos lingüísticos (LLM) a fin de enseñarles cómo seguir mejor las instrucciones. Cada línea contiene una tarea textual formulada en forma de instrucción, así como una respuesta asociada, que simula una interacción natural entre un usuario y una IA.
¿Para qué sirve este conjunto de datos?
- Entrene o perfeccione los modelos de LLM para que estén más alineados con las instrucciones humanas
- Mejorar la calidad de los asistentes conversacionales en varios contextos (atención al cliente, herramientas educativas, etc.)
- Probando la solidez de los LLM en millones de casos variados y realistas
¿Se puede enriquecer o mejorar?
Sí. El HQIT se puede enriquecer con traducciones, anotaciones adicionales (dificultad, categoría de tarea) o una selección temática. También se puede utilizar como base para crear conjuntos de datos multilingües o multidominio.
🔎 En resumen
🧠 Recomendado para
- Desarrolladores LLM
- Investigadores de PNL
- Startups de IA
🔧 Herramientas compatibles
- Hugging Face Transformers
- LoRA
- DeepSpeed
- LangChain
💡 Consejo
Filtre los pares más largos para preentrenar de manera más eficaz en infraestructuras ligeras.
Preguntas frecuentes
¿Se puede usar este conjunto de datos para capacitar a un asistente de chat personalizado?
Sí, el HQIT proporciona una base ideal para capacitar a un asistente mediante instrucciones de ajuste en millones de casos realistas.
¿Los datos son multilingües?
El conjunto de datos aparece principalmente en inglés. Es posible traducirlo para crear una versión multilingüe adecuada.
¿Es adecuado para el entrenamiento en GPU limitadas?
Sí, al aplicar el muestreo o técnicas como LoRa, se puede explotar con recursos limitados.




