En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
OGC MEGA MultiDomain DocRetrieval
Image

OGC MEGA MultiDomain DocRetrieval

Dataset massif combinant plusieurs sources pour entraîner des modèles de recherche documentaire visuelle en multilingue, avec support du contraste négatif.

Télécharger le dataset
Taille

Environ 1,09 million d’exemples avec images, textes de requêtes, langues (fr, en, de, es, it), formats JSON + images PNG/JPEG

Licence

Apache 2.0

Description

OGC MEGA MultiDomain DocRetrieval est le plus vaste dataset open-source dédié à la recherche documentaire visuelle. Il combine plus d’un million d’exemples issus de sept sources différentes, couvrant les domaines militaire, énergétique, géotechnique, et plus encore. Chaque entrée contient une requête textuelle, une image principale, et jusqu’à 16 images négatives permettant d’entraîner des modèles de type contrastif. Le dataset est structuré et multilingue, couvrant cinq langues principales dont le français, l’anglais, l’allemand, l’espagnol et l’italien.

À quoi sert ce dataset ?

  • Entraîner des modèles de recherche documentaire visuelle performants
  • Appliquer des approches de contrastive learning pour améliorer la pertinence des systèmes de recherche
  • Renforcer la robustesse des modèles sur des documents multilingues et variés

Peut-on l’enrichir ou l’améliorer ?

Oui. On peut annoter manuellement la pertinence des correspondances, ajouter d'autres langues, ou encore intégrer des métadonnées comme le type de document ou son origine sectorielle. Le dataset est suffisamment modulaire pour permettre l’extension thématique ou linguistique.

🔎 En résumé

Critère Évaluation
🧩Facilité d’utilisation ⭐⭐☆☆☆ (moyenne – nécessite prétraitement d’image et de texte)
🧼Besoin de nettoyage ⭐☆ (faible – bien structuré, mais gestion des fichiers image à prévoir)
🏷️Richesse des annotations ⭐⭐⭐⭐☆ (solide : texte, image, étiquettes négatives, langue)
📜Licence commerciale ✅ Oui (Apache 2.0)
👨‍💻Idéal pour les débutants ⚠️ Recommandé avec supervision – volume et complexité élevée
🔁Réutilisable en fine-tuning 💪 Parfait pour modèles contrastifs ou retrieval multimodal
🌍Diversité culturelle 🌟 Excellente – multilingue et multi-domaines

🧠 Recommandé pour

  • laboratoires NLP multimodal
  • ingénieurs RAG
  • systèmes de documentation industrielle

🔧 Outils compatibles

  • CLIP
  • BLIP-2
  • Hugging Face Transformers
  • Faiss
  • OpenAI Embeddings

💡 Astuce

Pensez à équilibrer les langues ou domaines dans vos batches pour éviter un biais d’entraînement.

Questions fréquemment posées

Le dataset contient-il des images annotées manuellement ?

Non, les correspondances sont implicites via la structure de données. Les exemples négatifs sont définis par champ, mais non annotés individuellement.

Est-ce que toutes les langues ont le même volume de données ?

Non, l’anglais est majoritaire (~64%), mais le français représente ~20%, suivi de l’allemand, espagnol et italien.

Est-il compatible avec les modèles comme CLIP ou BLIP ?

Oui, il est parfaitement adapté aux architectures contrastives ou bimodales comme CLIP, BLIP ou OpenCLIP.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.