OmniSpatial – Benchmark de Raisonnement Spatial Multimodal
OmniSpatial est un benchmark conçu pour tester les capacités de raisonnement spatial des modèles vision-langage. Le dataset comprend des questions à choix multiples couvrant quatre types de tâches : raisonnement dynamique, interaction spatiale, logique complexe et prise de perspective. Chaque question est liée à une image et comprend des options avec la bonne réponse indiquée.
Questions annotées au format JSON avec schéma structuré, plusieurs milliers d’items présumés
Apache 2.0
Description
OmniSpatial propose un ensemble de questions structurées en JSON, destinées à évaluer le raisonnement spatial des modèles multimodaux combinant vision et langage. Les tâches couvrent l’analyse du mouvement, les interactions spatiales, la logique complexe et la prise de perspective.
À quoi sert ce dataset ?
- Tester la compréhension spatiale et dynamique des modèles VLM
- Évaluer la capacité de raisonnement multi-étapes dans des contextes visuels complexes
- Améliorer la robustesse des modèles sur des tâches de vision-langage avancées
Peut-on l’enrichir ou l’améliorer ?
Le dataset peut être enrichi par l’ajout de nouvelles images, scénarios, et types de questions, notamment en affinant les sous-catégories de tâches. La contribution communautaire peut élargir la diversité des contextes spatiaux et dynamiques.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en vision-langage
- Développeurs de modèles multimodaux
- Ingénieurs IA
🔧 Outils compatibles
- Python JSON parsers
- PyTorch
- TensorFlow
- Frameworks VLM
💡 Astuce
Exploiter la structure JSON pour automatiser la création de jeux de tests personnalisés.
Questions fréquemment posées
Quelles sont les principales catégories de tâches couvertes par ce dataset ?
Raisonnement dynamique, interaction spatiale, logique complexe, et prise de perspective.
Ce dataset comprend-il des images originales ?
Oui, chaque question est associée à une image utilisée pour le raisonnement spatial.
Peut-on utiliser ce dataset pour fine-tuning de modèles multimodaux ?
Oui, il est conçu pour entraîner et évaluer des modèles combinant vision et langage sur des tâches complexes.




