OGC MEGA MultiDomain DocRetrieval
Dataset massif combinant plusieurs sources pour entraîner des modèles de recherche documentaire visuelle en multilingue, avec support du contraste négatif.
Environ 1,09 million d’exemples avec images, textes de requêtes, langues (fr, en, de, es, it), formats JSON + images PNG/JPEG
Apache 2.0
Description
OGC MEGA MultiDomain DocRetrieval est le plus vaste dataset open-source dédié à la recherche documentaire visuelle. Il combine plus d’un million d’exemples issus de sept sources différentes, couvrant les domaines militaire, énergétique, géotechnique, et plus encore. Chaque entrée contient une requête textuelle, une image principale, et jusqu’à 16 images négatives permettant d’entraîner des modèles de type contrastif. Le dataset est structuré et multilingue, couvrant cinq langues principales dont le français, l’anglais, l’allemand, l’espagnol et l’italien.
À quoi sert ce dataset ?
- Entraîner des modèles de recherche documentaire visuelle performants
- Appliquer des approches de contrastive learning pour améliorer la pertinence des systèmes de recherche
- Renforcer la robustesse des modèles sur des documents multilingues et variés
Peut-on l’enrichir ou l’améliorer ?
Oui. On peut annoter manuellement la pertinence des correspondances, ajouter d'autres langues, ou encore intégrer des métadonnées comme le type de document ou son origine sectorielle. Le dataset est suffisamment modulaire pour permettre l’extension thématique ou linguistique.
🔎 En résumé
🧠 Recommandé pour
- laboratoires NLP multimodal
- ingénieurs RAG
- systèmes de documentation industrielle
🔧 Outils compatibles
- CLIP
- BLIP-2
- Hugging Face Transformers
- Faiss
- OpenAI Embeddings
💡 Astuce
Pensez à équilibrer les langues ou domaines dans vos batches pour éviter un biais d’entraînement.
Questions fréquemment posées
Le dataset contient-il des images annotées manuellement ?
Non, les correspondances sont implicites via la structure de données. Les exemples négatifs sont définis par champ, mais non annotés individuellement.
Est-ce que toutes les langues ont le même volume de données ?
Non, l’anglais est majoritaire (~64%), mais le français représente ~20%, suivi de l’allemand, espagnol et italien.
Est-il compatible avec les modèles comme CLIP ou BLIP ?
Oui, il est parfaitement adapté aux architectures contrastives ou bimodales comme CLIP, BLIP ou OpenCLIP.



