En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
DAIGT Proper Train Dataset
Texte

DAIGT Proper Train Dataset

Dataset textuel composé de plusieurs milliers d’exemples destinés à entraîner des modèles pour détecter du texte généré par IA. Il regroupe des textes générés par divers grands modèles de langage (ChatGPT, LLaMA, Falcon, Claude, Mistral) ainsi que des essais officiels. Ce corpus est adapté pour le fine-tuning et l’évaluation des modèles de détection d’IA.

Télécharger le dataset
Taille

Plusieurs milliers d’essais textuels au format texte brut ou JSON

Licence

MIT

Description

Le DAIGT Proper Train Dataset est un corpus textuel riche comprenant plusieurs milliers d’exemples d’essais générés par différents modèles de langage IA ainsi que des essais humains. Il contient des métadonnées telles que l’ID d’essai et le prompt de génération lorsque disponibles. Ce dataset est conçu pour les compétitions et projets de détection de texte généré par IA.

À quoi sert ce dataset ?

  • Entraîner des modèles de classification pour distinguer texte humain et texte IA
  • Évaluer la robustesse des détecteurs d’IA sur des données variées
  • Fine-tuning pour amélioration de la détection dans différents contextes

Peut-on l’enrichir ou l’améliorer ?

Oui, il est possible d’ajouter des textes générés par de nouveaux modèles ou d’intégrer des annotations supplémentaires (ex. : difficulté, sujet). Le dataset peut aussi être stratifié par source ou prompt pour analyses fines.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Dataset prêt à l’emploi, métadonnées utiles)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – données bien organisées)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne – métadonnées sur source et prompts)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants🌟 Adapté aux utilisateurs débutants et avancés
🔁 Réutilisable en fine-tuning🎯 Excellent pour détection et classification texte IA
🌍 Diversité culturelle📖 Textes variés produits par plusieurs modèles LLM

🧠 Recommandé pour

  • Chercheurs NLP
  • Équipes de détection IA
  • Compétiteurs en IA générative

🔧 Outils compatibles

  • Hugging Face Transformers
  • Scikit-learn
  • PyTorch
  • TensorFlow

💡 Astuce

Utilisez les métadonnées pour créer des jeux d’entraînement équilibrés et variés.

Questions fréquemment posées

Ce dataset contient-il uniquement du texte généré par IA ?

Non, il contient aussi des essais humains pour permettre un apprentissage équilibré.

Quelle est la licence du dataset ?

La licence est MIT, ce qui permet un usage libre y compris commercial.

Ce dataset peut-il être utilisé pour entraîner des détecteurs de plagiat ou similarité ?

Oui, il peut être utilisé pour ces tâches, notamment en complément d’autres corpus.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.