AI vs Human Generated Dataset
Ce dataset d’images juxtapose du contenu authentique provenant de Shutterstock et des images générées par IA, permettant d’entraîner des modèles de détection de contenu synthétique.
85 500 images (JPEG), accompagnées de 4 colonnes de métadonnées
Apache 2.0
Description
Ce corpus comprend 85 500 images réparties en deux catégories : images authentiques issues de Shutterstock, et équivalents générés par des modèles d’IA de pointe. Il permet une analyse comparative rigoureuse, avec une structure équilibrée (incluant des images de personnes humaines).
À quoi sert ce dataset ?
- Développer des modèles de détection d’images générées par IA
- Créer des benchmarks pour évaluer la véracité du contenu visuel
- Étudier les différences perceptibles entre visuels synthétiques et réels
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible d’y ajouter des annotations supplémentaires (niveau de réalisme, type de génération, taux de réussite de détection humaine), ou d’augmenter le corpus avec d’autres générateurs IA. Un enrichissement par étiquetage émotionnel ou contextuel peut aussi ouvrir de nouvelles pistes de recherche.
🔎 En résumé
🧠 Recommandé pour
- Développeurs IA en vision par ordinateur
- Chercheurs en cybersécurité visuelle
- Compétitions Kaggle
🔧 Outils compatibles
- PyTorch
- TensorFlow
- OpenCV
- Keras
- Label Studio
💡 Astuce
Pour tester vos modèles, appliquez un entraînement sur les images IA et réalisez un test croisé sur des générations issues d'autres outils (DALL·E, Midjourney, etc.)
Questions fréquemment posées
Les images sont-elles toutes étiquetées selon leur origine ?
Oui, chaque image est accompagnée de métadonnées précisant si elle est authentique ou générée par IA, ce qui facilite l’entraînement supervisé.
Ce dataset peut-il être utilisé dans un contexte commercial ?
Oui, la licence Apache 2.0 autorise l’exploitation commerciale, tant que les conditions de la licence sont respectées.
Ce dataset est-il adapté à la détection de deepfakes ?
Il est plus adapté à la détection d’images générées artificiellement (synthèse générale), mais peut être combiné avec d’autres corpus spécialisés pour le deepfake.




