En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
OmniSpatial – Benchmark de Raisonnement Spatial Multimodal
Multimodal

OmniSpatial – Benchmark de Raisonnement Spatial Multimodal

OmniSpatial est un benchmark conçu pour tester les capacités de raisonnement spatial des modèles vision-langage. Le dataset comprend des questions à choix multiples couvrant quatre types de tâches : raisonnement dynamique, interaction spatiale, logique complexe et prise de perspective. Chaque question est liée à une image et comprend des options avec la bonne réponse indiquée.

Télécharger le dataset
Taille

Questions annotées au format JSON avec schéma structuré, plusieurs milliers d’items présumés

Licence

Apache 2.0

Description

OmniSpatial propose un ensemble de questions structurées en JSON, destinées à évaluer le raisonnement spatial des modèles multimodaux combinant vision et langage. Les tâches couvrent l’analyse du mouvement, les interactions spatiales, la logique complexe et la prise de perspective.

À quoi sert ce dataset ?

  • Tester la compréhension spatiale et dynamique des modèles VLM
  • Évaluer la capacité de raisonnement multi-étapes dans des contextes visuels complexes
  • Améliorer la robustesse des modèles sur des tâches de vision-langage avancées

Peut-on l’enrichir ou l’améliorer ?

Le dataset peut être enrichi par l’ajout de nouvelles images, scénarios, et types de questions, notamment en affinant les sous-catégories de tâches. La contribution communautaire peut élargir la diversité des contextes spatiaux et dynamiques.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Bien structuré, nécessite compréhension JSON et vision-langage)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible, données bien annotées)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Complète, avec catégories détaillées et réponses validées)
📜 Licence commerciale✅ Oui (Apache 2.0)
👨‍💻 Idéal pour les débutants⚠️ Moyennement, utile pour utilisateurs avec base multimodale
🔁 Réutilisable en fine-tuning🎯 Adapté pour fine-tuning sur raisonnement spatial et VLM
🌍 Diversité culturelle⚠️ Focus technique, diversité visuelle à développer

🧠 Recommandé pour

  • Chercheurs en vision-langage
  • Développeurs de modèles multimodaux
  • Ingénieurs IA

🔧 Outils compatibles

  • Python JSON parsers
  • PyTorch
  • TensorFlow
  • Frameworks VLM

💡 Astuce

Exploiter la structure JSON pour automatiser la création de jeux de tests personnalisés.

Questions fréquemment posées

Quelles sont les principales catégories de tâches couvertes par ce dataset ?

Raisonnement dynamique, interaction spatiale, logique complexe, et prise de perspective.

Ce dataset comprend-il des images originales ?

Oui, chaque question est associée à une image utilisée pour le raisonnement spatial.

Peut-on utiliser ce dataset pour fine-tuning de modèles multimodaux ?

Oui, il est conçu pour entraîner et évaluer des modèles combinant vision et langage sur des tâches complexes.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.