En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
LLM Prompt Recovery Data Gemini and Gemma
Texte

LLM Prompt Recovery Data Gemini and Gemma

Ce dataset contient des paires de prompts originaux et reformulés, ainsi que les textes générés par deux systèmes : Gemini et Gemma. Il est destiné à améliorer et évaluer la capacité des modèles LLM à comprendre et reformuler des prompts.

Télécharger le dataset
Taille

Plusieurs centaines d’exemples textuels au format JSON/CSV (non précisé)

Licence

Apache 2.0

Description

LLM Prompt Recovery Data Gemini and Gemma rassemble des données sur les prompts originaux d’essais, les prompts fournis à Gemini et Gemma, et les textes réécrits générés par ces deux modèles. Il s’agit d’un corpus utile pour l’analyse et l’amélioration des capacités de reformulation et génération de prompts.

À quoi sert ce dataset ?

  • Évaluer la qualité de reformulation des prompts par des modèles LLM
  • Entraîner des modèles à comprendre et réécrire des instructions textuelles
  • Améliorer la génération automatique de prompts pour des tâches spécifiques

Peut-on l’enrichir ou l’améliorer ?

Ce dataset peut être complété par des annotations qualitatives sur la cohérence ou la fidélité des reformulations, ainsi que par des données supplémentaires issues d’autres modèles pour accroître la diversité.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Structure claire, données textuelles simples à manipuler)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible, données bien formatées)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Moyenne, prompts et sorties mais pas d’évaluations humaines)
📜 Licence commerciale✅ Oui (Apache 2.0)
👨‍💻 Idéal pour les débutants⚠️ Adapté aux chercheurs débutants en NLP
🔁 Réutilisable en fine-tuning⚠️ Utile pour fine-tuning sur reformulation et génération
🌍 Diversité culturelle🇬🇧 Neutre, données textuelles en anglais

🧠 Recommandé pour

  • Chercheurs en NLP
  • Développeurs LLM
  • Data scientists

🔧 Outils compatibles

  • Hugging Face Transformers
  • TensorFlow
  • PyTorch
  • Jupyter Notebooks

💡 Astuce

Vérifier la cohérence des reformulations avant entraînement pour garantir la qualité du fine-tuning.

Questions fréquemment posées

Quel type de données contient ce dataset ?

Des prompts originaux, des prompts reformulés et les textes générés par deux modèles nommés Gemini et Gemma.

Ce dataset est-il adapté à l’entraînement de modèles de reformulation ?

Oui, il contient des paires utiles pour entraîner et évaluer la reformulation de prompts.

La licence permet-elle une utilisation commerciale ?

Oui, la licence Apache 2.0 permet une utilisation commerciale et modifiée.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.