PD12M : Collection d’images du domaine public
PD12M est un large dataset d’images du domaine public, contenant 12 millions d’éléments filtrés avec liens actifs. Chaque image est accompagnée de métadonnées EXIF, d’un vecteur d’embedding optimisé pour la recherche et indexation vectorielle, facilitant les requêtes avancées et applications en vision par ordinateur.
12 millions d’images publiques, format JPEG/PNG, vecteurs 16-bit half-precision (1152 dimensions) optimisés pour indexation L2
Apache 2.0
Description
Le dataset PD12M rassemble une collection massive d’images du domaine public, enrichies de métadonnées détaillées telles que EXIF et descriptions longues. Les images sont prétraitées et dotées d’embeddings vectoriels de haute précision, adaptés à la recherche par similarité et à l’indexation efficace.
À quoi sert ce dataset ?
- Recherche d’images et correspondances par similarité dans de larges bases
- Entraînement et évaluation de modèles de vision par ordinateur ou multimodaux
- Développement d’applications IA exploitant les métadonnées EXIF et embeddings vectoriels
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible d’ajouter des annotations personnalisées, d’étendre les métadonnées, ou d’actualiser régulièrement le dataset avec de nouvelles images publiques. La normalisation des formats et l’optimisation des embeddings peuvent aussi être adaptées selon les besoins spécifiques.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en vision par ordinateur
- Développeurs de recherche vectorielle
- Projets IA multimodaux
🔧 Outils compatibles
- PostgreSQL avec extensions vectorchord/pg_search
- Python
- FAISS
- Annoy
💡 Astuce
Utilisez les embeddings normalisés pour accélérer les recherches similaires et optimiser la précision des résultats.
Questions fréquemment posées
Ce dataset contient-il uniquement des images libres de droits ?
Oui, toutes les images proviennent du domaine public et sont libres de droits pour utilisation commerciale et non commerciale.
Quel type de métadonnées accompagne les images ?
Le dataset inclut des métadonnées EXIF, descriptions longues, dimensions, et embeddings vectoriels pour chaque image.
Faut-il des compétences techniques spécifiques pour utiliser PD12M ?
Oui, une connaissance en bases de données relationnelles et indexation vectorielle est recommandée pour exploiter pleinement ce dataset.




