OmniSpatial – Benchmark de razonamiento espacial multimodal
OmniSpatial es una referencia diseñada para poner a prueba las capacidades de razonamiento espacial de los modelos de lenguaje visual. El conjunto de datos incluye preguntas de opción múltiple que abarcan cuatro tipos de tareas: razonamiento dinámico, interacción espacial, lógica compleja y toma de perspectiva. Cada pregunta está vinculada a una imagen e incluye las opciones correspondientes, indicando la respuesta correcta.
Preguntas anotadas en formato JSON con esquema estructurado, con varios miles de elementos.
Apache 2.0
Descripción
Omnispatial propone un conjunto de preguntas estructuradas en JSON, destinadas a evaluar el razonamiento espacial de los modelos multimodales que combinan visión y lenguaje. Las tareas abarcan el análisis del movimiento, las interacciones espaciales, la lógica compleja y la toma de perspectiva.
¿Para qué sirve este conjunto de datos?
- Poner a prueba la comprensión espacial y dinámica de los modelos VLM
- Evaluar la capacidad de razonamiento en varias etapas en contextos visuales complejos
- Mejorar la solidez de los modelos en tareas avanzadas de lenguaje visual
¿Se puede enriquecer o mejorar?
El conjunto de datos puede enriquecerse añadiendo nuevas imágenes, escenarios y tipos de preguntas, especialmente mediante el refinamiento de las subcategorías de tareas. La contribución de la comunidad puede ampliar la diversidad de contextos espaciales y dinámicos.
🔎 En resumen
🧠 Recomendado para
- Investigadores de lenguaje visual
- Desarrolladores de modelos multimodales
- Ingenieros de IA
🔧 Herramientas compatibles
- Analizadores JSON de Python
- PyTorch
- TensorFlow
- Frameworks VLM
💡 Consejo
Aproveche la estructura JSON para automatizar la creación de conjuntos de pruebas personalizados.
Preguntas frecuentes
¿Cuáles son las principales categorías de tareas que abarca este conjunto de datos?
Razonamiento dinámico, interacción espacial, lógica compleja y toma de perspectiva.
¿Este conjunto de datos incluye imágenes originales?
Sí, cada pregunta está asociada a una imagen utilizada para el razonamiento espacial.
¿Se puede usar este conjunto de datos para ajustar los modelos multimodales?
Sí, está diseñado para entrenar y evaluar modelos que combinan visión y lenguaje en tareas complejas.




