Fondant CC 25M
Un vaste dataset de 25 millions d’URLs d’images extraites du web, avec informations de licence Creative Commons, idéal pour créer ou affiner des modèles de génération et vision par ordinateur.
25M images (via URLs), métadonnées JSON, liens + licence
Creative Commons (images individuelles sous licences CC)
Description
Fondant CC 25M est un dataset open-source massif contenant 25 millions d’URLs d’images collectées à partir du web via Common Crawl. Chaque lien est associé à une licence Creative Commons, garantissant la réutilisabilité des contenus. Ce dataset a été construit avec le framework Fondant, permettant une reproductibilité efficace pour les pipelines à grande échelle.
À quoi sert ce dataset ?
- Préparer des datasets visuels libres de droits pour l’entraînement de modèles
- Évaluer des modèles de génération ou de recherche d’images en conditions réelles
- Créer des corpus thématiques d’images (via filtrage de domaine, type, etc.)
Peut-on l’enrichir ou l’améliorer ?
Oui. Ce dataset est une base brute que l’on peut filtrer, trier et enrichir par classification, clustering ou validation humaine. Il est aussi possible d’y associer des vecteurs d’images ou métadonnées additionnelles (catégories, couleurs, source...).
🔎 En résumé
🧠 Recommandé pour
- Projets de génération d’image
- Crawl personnalisé
- Constitution de dataset libre
🔧 Outils compatibles
- Fondant
- DuckDB
- FastDownload
- Datasets Hugging Face
- PyTorch
💡 Astuce
Filtrez les images par domaine (gov, edu, org) pour améliorer la fiabilité et la diversité culturelle.
Questions fréquemment posées
Ce dataset contient-il les images elles-mêmes ?
Non, il contient uniquement des URLs vers des images disponibles publiquement, avec leur licence. Il faut les télécharger soi-même.
Peut-on l’utiliser pour un projet commercial ?
Oui, tant que chaque image respecte bien la licence CC associée. Un filtrage par type de licence est recommandé.
Est-il possible de filtrer le dataset avant usage ?
Oui, le dataset est compatible avec des outils comme Fondant ou Pandas pour trier par domaine, type d’image, langue, etc.




