LLM Prompt Recovery Data Gemini and Gemma
Ce dataset contient des paires de prompts originaux et reformulés, ainsi que les textes générés par deux systèmes : Gemini et Gemma. Il est destiné à améliorer et évaluer la capacité des modèles LLM à comprendre et reformuler des prompts.
Plusieurs centaines d’exemples textuels au format JSON/CSV (non précisé)
Apache 2.0
Description
LLM Prompt Recovery Data Gemini and Gemma rassemble des données sur les prompts originaux d’essais, les prompts fournis à Gemini et Gemma, et les textes réécrits générés par ces deux modèles. Il s’agit d’un corpus utile pour l’analyse et l’amélioration des capacités de reformulation et génération de prompts.
À quoi sert ce dataset ?
- Évaluer la qualité de reformulation des prompts par des modèles LLM
- Entraîner des modèles à comprendre et réécrire des instructions textuelles
- Améliorer la génération automatique de prompts pour des tâches spécifiques
Peut-on l’enrichir ou l’améliorer ?
Ce dataset peut être complété par des annotations qualitatives sur la cohérence ou la fidélité des reformulations, ainsi que par des données supplémentaires issues d’autres modèles pour accroître la diversité.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP
- Développeurs LLM
- Data scientists
🔧 Outils compatibles
- Hugging Face Transformers
- TensorFlow
- PyTorch
- Jupyter Notebooks
💡 Astuce
Vérifier la cohérence des reformulations avant entraînement pour garantir la qualité du fine-tuning.
Questions fréquemment posées
Quel type de données contient ce dataset ?
Des prompts originaux, des prompts reformulés et les textes générés par deux modèles nommés Gemini et Gemma.
Ce dataset est-il adapté à l’entraînement de modèles de reformulation ?
Oui, il contient des paires utiles pour entraîner et évaluer la reformulation de prompts.
La licence permet-elle une utilisation commerciale ?
Oui, la licence Apache 2.0 permet une utilisation commerciale et modifiée.




