OGC MEGA MultiDomain DocRetrieval
Conjunto de datos masivo que combina varias fuentes para entrenar modelos de investigación documental visual multilingües, con soporte de contraste negativo.
Alrededor de 1,09 millones de ejemplos con imágenes, textos de consulta, idiomas (fr, en, de, es, it), formatos JSON e imágenes PNG/JPEG
Apache 2.0
Descripción
OGC MEGA MultiDomain DocRetrieval es el mayor conjunto de datos de código abierto dedicado a la investigación documental visual. Combina más de un millón de ejemplos de siete fuentes diferentes, que abarcan temas militares, energéticos, geotécnicos y más. Cada entrada contiene una consulta de texto, una imagen principal y hasta 16 imágenes negativas que se pueden usar para entrenar modelos contrastantes. El conjunto de datos está estructurado y es multilingüe y abarca cinco idiomas principales, incluidos el francés, el inglés, el alemán, el español y el italiano.
¿Para qué sirve este conjunto de datos?
- Entrene modelos eficientes de búsqueda visual de literatura
- Aplicar enfoques de aprendizaje contrastivo para mejorar la relevancia de los sistemas de búsqueda
- Reforzar la solidez de los modelos de documentos multilingües y variados
¿Se puede enriquecer o mejorar?
Sí. Puede anotar manualmente la relevancia de la correspondencia, añadir otros idiomas o incluso integrar metadatos como el tipo de documento o su origen sectorial. El conjunto de datos es lo suficientemente modular como para permitir la extensión temática o lingüística.
🔎 En resumen
🧠 Recomendado para
- Laboratorios multimodales de PNL
- Ingenieros de RAG
- Sistemas de documentación industrial
🔧 Herramientas compatibles
- CLIP
- BLIP-2
- Hugging Face Transformers
- Faiss
- OpenAI Embeddings
💡 Consejo
Recuerde equilibrar los idiomas o los dominios en sus lotes para evitar sesgos de entrenamiento.
Preguntas frecuentes
¿El conjunto de datos contiene imágenes anotadas manualmente?
No, las coincidencias están implícitas en la estructura de datos. Los ejemplos negativos se definen por campo, pero no se anotan de forma individual.
¿Todos los idiomas tienen la misma cantidad de datos?
No, el inglés es la mayoría (~ 64%), pero el francés representa ~ el 20%, seguido del alemán, el español y el italiano.
¿Es compatible con modelos como CLIP o BLIP?
Sí, se adapta perfectamente a arquitecturas contrastantes o bimodales como CLIP, BLIP u OpenCLIP.




