En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Fondant CC 25M
Image

Fondant CC 25M

Un vaste dataset de 25 millions d’URLs d’images extraites du web, avec informations de licence Creative Commons, idéal pour créer ou affiner des modèles de génération et vision par ordinateur.

Télécharger le dataset
Taille

25M images (via URLs), métadonnées JSON, liens + licence

Licence

Creative Commons (images individuelles sous licences CC)

Description

Fondant CC 25M est un dataset open-source massif contenant 25 millions d’URLs d’images collectées à partir du web via Common Crawl. Chaque lien est associé à une licence Creative Commons, garantissant la réutilisabilité des contenus. Ce dataset a été construit avec le framework Fondant, permettant une reproductibilité efficace pour les pipelines à grande échelle.

À quoi sert ce dataset ?

  • Préparer des datasets visuels libres de droits pour l’entraînement de modèles
  • Évaluer des modèles de génération ou de recherche d’images en conditions réelles
  • Créer des corpus thématiques d’images (via filtrage de domaine, type, etc.)

Peut-on l’enrichir ou l’améliorer ?

Oui. Ce dataset est une base brute que l’on peut filtrer, trier et enrichir par classification, clustering ou validation humaine. Il est aussi possible d’y associer des vecteurs d’images ou métadonnées additionnelles (catégories, couleurs, source...).

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐✩✩✩ (Requiert un traitement initial - téléchargement, filtrage)
🧼 Besoin de nettoyage⭐⭐✩✩✩ (Élevé – les liens peuvent être brisés ou obsolètes)
🏷️ Richesse des annotations⭐⭐✩✩✩ (Limité – uniquement URL + licence)
📜 Licence commerciale⚠️ Oui (selon la licence CC de chaque image)
👨‍💻 Idéal pour les débutants⚠️ Non – nécessite des outils d’automatisation
🔁 Réutilisable en fine-tuning✅ Oui, après filtrage et traitement
🌍 Diversité culturelle🌐 Élevée – contenu web global et varié

🧠 Recommandé pour

  • Projets de génération d’image
  • Crawl personnalisé
  • Constitution de dataset libre

🔧 Outils compatibles

  • Fondant
  • DuckDB
  • FastDownload
  • Datasets Hugging Face
  • PyTorch

💡 Astuce

Filtrez les images par domaine (gov, edu, org) pour améliorer la fiabilité et la diversité culturelle.

Questions fréquemment posées

Ce dataset contient-il les images elles-mêmes ?

Non, il contient uniquement des URLs vers des images disponibles publiquement, avec leur licence. Il faut les télécharger soi-même.

Peut-on l’utiliser pour un projet commercial ?

Oui, tant que chaque image respecte bien la licence CC associée. Un filtrage par type de licence est recommandé.

Est-il possible de filtrer le dataset avant usage ?

Oui, le dataset est compatible avec des outils comme Fondant ou Pandas pour trier par domaine, type d’image, langue, etc.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.