DAIGT Proper Train Dataset
Dataset textuel composé de plusieurs milliers d’exemples destinés à entraîner des modèles pour détecter du texte généré par IA. Il regroupe des textes générés par divers grands modèles de langage (ChatGPT, LLaMA, Falcon, Claude, Mistral) ainsi que des essais officiels. Ce corpus est adapté pour le fine-tuning et l’évaluation des modèles de détection d’IA.
Plusieurs milliers d’essais textuels au format texte brut ou JSON
MIT
Description
Le DAIGT Proper Train Dataset est un corpus textuel riche comprenant plusieurs milliers d’exemples d’essais générés par différents modèles de langage IA ainsi que des essais humains. Il contient des métadonnées telles que l’ID d’essai et le prompt de génération lorsque disponibles. Ce dataset est conçu pour les compétitions et projets de détection de texte généré par IA.
À quoi sert ce dataset ?
- Entraîner des modèles de classification pour distinguer texte humain et texte IA
- Évaluer la robustesse des détecteurs d’IA sur des données variées
- Fine-tuning pour amélioration de la détection dans différents contextes
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible d’ajouter des textes générés par de nouveaux modèles ou d’intégrer des annotations supplémentaires (ex. : difficulté, sujet). Le dataset peut aussi être stratifié par source ou prompt pour analyses fines.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs NLP
- Équipes de détection IA
- Compétiteurs en IA générative
🔧 Outils compatibles
- Hugging Face Transformers
- Scikit-learn
- PyTorch
- TensorFlow
💡 Astuce
Utilisez les métadonnées pour créer des jeux d’entraînement équilibrés et variés.
Questions fréquemment posées
Ce dataset contient-il uniquement du texte généré par IA ?
Non, il contient aussi des essais humains pour permettre un apprentissage équilibré.
Quelle est la licence du dataset ?
La licence est MIT, ce qui permet un usage libre y compris commercial.
Ce dataset peut-il être utilisé pour entraîner des détecteurs de plagiat ou similarité ?
Oui, il peut être utilisé pour ces tâches, notamment en complément d’autres corpus.




