Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
LLM Prompt Recovery Data Gemini and Gemma
Texto

LLM Prompt Recovery Data Gemini and Gemma

Este conjunto de datos contiene pares de mensajes originales y reformulados, así como textos generados por dos sistemas: Gemini y Gemma. Su objetivo es mejorar y evaluar la capacidad de los modelos de LLM para comprender y reformular las instrucciones.

Obtén el dataset
Tamaño

Varios cientos de ejemplos de texto en formato JSON/CSV (no especificado)

Licencia

Apache 2.0

Descripción

LLM Prompt Recovery Data Gemini and Gemma recopila datos sobre las indicaciones de prueba originales, las instrucciones proporcionadas a Gemini y Gemma y los textos reescritos generados por estos dos modelos. Es un corpus útil para el análisis y la mejora de las capacidades de reformulación y generación de indicaciones.

¿Para qué sirve este conjunto de datos?

  • Evalúe la calidad de la reformulación de las instrucciones utilizando modelos LLM
  • Entrene a los modelos para que entiendan y reescriban las instrucciones de texto
  • Mejore la generación automática de indicaciones para tareas específicas

¿Se puede enriquecer o mejorar?

Este conjunto de datos se puede complementar con anotaciones cualitativas sobre la consistencia o fidelidad de las reformulaciones, así como con datos adicionales de otros modelos para aumentar la diversidad.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Estructura clara, datos textuales simples de manipular)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo, datos bien formateados)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Moderado, prompts y salidas pero sin evaluaciones humanas)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes⚠️ Adecuado para investigadores principiantes en NLP
🔁 Reutilizable para fine-tuning⚠️ Útil para fine-tuning en reformulación y generación
🌍 Diversidad cultural🇬🇧 Neutro, datos textuales en inglés

🧠 Recomendado para

  • Investigadores de PNL
  • Desarrolladores LLM
  • Científicos de datos

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • TensorFlow
  • PyTorch
  • Jupyter Notebooks

💡 Consejo

Compruebe la coherencia de las reformulaciones antes del entrenamiento para garantizar la calidad del ajuste.

Preguntas frecuentes

¿Qué tipo de datos contiene este conjunto de datos?

Indicaciones originales, instrucciones reformuladas y textos generados por dos modelos llamados Gemini y Gemma.

¿Este conjunto de datos es adecuado para entrenar modelos de reformulación?

Sí, contiene pares que son útiles para entrenar y evaluar la reformulación de las indicaciones.

¿La licencia permite el uso comercial?

Sí, la licencia Apache 2.0 permite el uso comercial y modificado.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.