Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
OmniSpatial – Benchmark de razonamiento espacial multimodal
Multimodal

OmniSpatial – Benchmark de razonamiento espacial multimodal

OmniSpatial es una referencia diseñada para poner a prueba las capacidades de razonamiento espacial de los modelos de lenguaje visual. El conjunto de datos incluye preguntas de opción múltiple que abarcan cuatro tipos de tareas: razonamiento dinámico, interacción espacial, lógica compleja y toma de perspectiva. Cada pregunta está vinculada a una imagen e incluye las opciones correspondientes, indicando la respuesta correcta.

Obtén el dataset
Tamaño

Preguntas anotadas en formato JSON con esquema estructurado, con varios miles de elementos.

Licencia

Apache 2.0

Descripción

Omnispatial propone un conjunto de preguntas estructuradas en JSON, destinadas a evaluar el razonamiento espacial de los modelos multimodales que combinan visión y lenguaje. Las tareas abarcan el análisis del movimiento, las interacciones espaciales, la lógica compleja y la toma de perspectiva.

¿Para qué sirve este conjunto de datos?

  • Poner a prueba la comprensión espacial y dinámica de los modelos VLM
  • Evaluar la capacidad de razonamiento en varias etapas en contextos visuales complejos
  • Mejorar la solidez de los modelos en tareas avanzadas de lenguaje visual

¿Se puede enriquecer o mejorar?

El conjunto de datos puede enriquecerse añadiendo nuevas imágenes, escenarios y tipos de preguntas, especialmente mediante el refinamiento de las subcategorías de tareas. La contribución de la comunidad puede ampliar la diversidad de contextos espaciales y dinámicos.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Bien estructurado, requiere comprensión de JSON y visión-lenguaje)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo, datos bien anotados)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Completo, con categorías detalladas y respuestas validadas)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes⚠️ Moderado, útil para usuarios con base multimodal
🔁 Reutilizable para fine-tuning🎯 Adecuado para fine-tuning en razonamiento espacial y VLM
🌍 Diversidad cultural⚠️ Enfoque técnico, diversidad visual a desarrollar

🧠 Recomendado para

  • Investigadores de lenguaje visual
  • Desarrolladores de modelos multimodales
  • Ingenieros de IA

🔧 Herramientas compatibles

  • Analizadores JSON de Python
  • PyTorch
  • TensorFlow
  • Frameworks VLM

💡 Consejo

Aproveche la estructura JSON para automatizar la creación de conjuntos de pruebas personalizados.

Preguntas frecuentes

¿Cuáles son las principales categorías de tareas que abarca este conjunto de datos?

Razonamiento dinámico, interacción espacial, lógica compleja y toma de perspectiva.

¿Este conjunto de datos incluye imágenes originales?

Sí, cada pregunta está asociada a una imagen utilizada para el razonamiento espacial.

¿Se puede usar este conjunto de datos para ajustar los modelos multimodales?

Sí, está diseñado para entrenar y evaluar modelos que combinan visión y lenguaje en tareas complejas.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.