Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
OGC MEGA MultiDomain DocRetrieval
Imagen

OGC MEGA MultiDomain DocRetrieval

Conjunto de datos masivo que combina varias fuentes para entrenar modelos de investigación documental visual multilingües, con soporte de contraste negativo.

Obtén el dataset
Tamaño

Alrededor de 1,09 millones de ejemplos con imágenes, textos de consulta, idiomas (fr, en, de, es, it), formatos JSON e imágenes PNG/JPEG

Licencia

Apache 2.0

Descripción

OGC MEGA MultiDomain DocRetrieval es el mayor conjunto de datos de código abierto dedicado a la investigación documental visual. Combina más de un millón de ejemplos de siete fuentes diferentes, que abarcan temas militares, energéticos, geotécnicos y más. Cada entrada contiene una consulta de texto, una imagen principal y hasta 16 imágenes negativas que se pueden usar para entrenar modelos contrastantes. El conjunto de datos está estructurado y es multilingüe y abarca cinco idiomas principales, incluidos el francés, el inglés, el alemán, el español y el italiano.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos eficientes de búsqueda visual de literatura
  • Aplicar enfoques de aprendizaje contrastivo para mejorar la relevancia de los sistemas de búsqueda
  • Reforzar la solidez de los modelos de documentos multilingües y variados

¿Se puede enriquecer o mejorar?

Sí. Puede anotar manualmente la relevancia de la correspondencia, añadir otros idiomas o incluso integrar metadatos como el tipo de documento o su origen sectorial. El conjunto de datos es lo suficientemente modular como para permitir la extensión temática o lingüística.

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐☆☆☆ (media – requiere preprocesamiento de imagen y texto)
🧼Necesidad de limpieza ⭐☆ (baja – bien estructurado, pero se requiere gestión de archivos de imagen)
🏷️Riqueza de las anotaciones ⭐⭐⭐⭐☆ (sólido: texto, imagen, etiquetas negativas, idioma)
📜Licencia comercial ✅ Sí (Apache 2.0)
👨‍💻Ideal para principiantes ⚠️ Recomendado con supervisión – alto volumen y complejidad
🔁Reutilizable en fine-tuning 💪 Perfecto para modelos contrastivos o de recuperación multimodal
🌍Diversidad cultural 🌟 Excelente – multilingüe y multidominio

🧠 Recomendado para

  • Laboratorios multimodales de PNL
  • Ingenieros de RAG
  • Sistemas de documentación industrial

🔧 Herramientas compatibles

  • CLIP
  • BLIP-2
  • Hugging Face Transformers
  • Faiss
  • OpenAI Embeddings

💡 Consejo

Recuerde equilibrar los idiomas o los dominios en sus lotes para evitar sesgos de entrenamiento.

Preguntas frecuentes

¿El conjunto de datos contiene imágenes anotadas manualmente?

No, las coincidencias están implícitas en la estructura de datos. Los ejemplos negativos se definen por campo, pero no se anotan de forma individual.

¿Todos los idiomas tienen la misma cantidad de datos?

No, el inglés es la mayoría (~ 64%), pero el francés representa ~ el 20%, seguido del alemán, el español y el italiano.

¿Es compatible con modelos como CLIP o BLIP?

Sí, se adapta perfectamente a arquitecturas contrastantes o bimodales como CLIP, BLIP u OpenCLIP.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.