En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
WM-ABench
Video

WM-ABench

WM-ABench est un benchmark destiné à tester la compréhension fine des modèles vision-langage sur la modélisation des dynamiques physiques à travers des vidéos simulées. Il couvre 23 dimensions différentes de modélisation du monde, avec des tâches de perception et de prédiction complexes.

Télécharger le dataset
Taille

Plus de 100 000 séquences vidéo annotées avec questions à choix multiple, issues de 6 simulateurs physiques

Licence

Apache 2.0

Description

Le dataset WM-ABench contient plus de 100 000 instances vidéo issues de 6 environnements de simulation physique. Chaque exemple comprend des séquences vidéo illustrant des interactions d'objets, accompagnées de questions à choix multiple avec des options proches mais incorrectes, afin d'évaluer la compréhension physique réelle des modèles vision-langage.

À quoi sert ce dataset ?

  • Évaluer les capacités de perception spatiale, temporelle et matérielle des modèles vision-langage
  • Tester la capacité à prédire les dynamiques physiques (chutes, collisions, actions complexes)
  • Servir de base pour le fine-tuning ou la validation de modèles avancés en vision et langage multimodal

Peut-on l’enrichir ou l’améliorer ?

Oui, il est possible d’ajouter des annotations supplémentaires comme des métadonnées plus fines sur les objets, des labels de complexité ou d'introduire de nouvelles scènes simulées. Le dataset peut aussi être étendu par remix ou combinaison avec d’autres benchmarks vidéo pour améliorer la diversité.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Format standard avec API disponible, nécessite des connaissances en multimédia)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – données simulées et bien structurées)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Excellente – questions à choix multiples avec "hard negatives" pour évaluation fine)
📜 Licence commerciale✅ Oui (Apache 2.0)
👨‍💻 Idéal pour les débutants⚠️ Moyennement – mieux avec expérience en vision par ordinateur et NLP
🔁 Réutilisable en fine-tuning🎯 Parfait pour fine-tuning de modèles vision-langage multimodaux
🌍 Diversité culturelle⚠️ Limité – dataset centré sur simulations physiques, peu d’éléments culturels

🧠 Recommandé pour

  • Chercheurs en vision par ordinateur
  • Développeurs de modèles multimodaux
  • Équipes IA en robotique

🔧 Outils compatibles

  • Hugging Face Datasets
  • PyTorch
  • TensorFlow
  • Simulateurs physiques compatibles

💡 Astuce

Utiliser les sous-ensembles plus petits pour des tests rapides avant de lancer l’entraînement complet.

Questions fréquemment posées

Quels types de questions sont posées aux modèles dans WM-ABench ?

Des questions à choix multiple portant sur la perception visuelle et la prédiction des dynamiques physiques dans des scènes simulées.

Ce dataset peut-il servir au fine-tuning de modèles vision-langage ?

Oui, il est parfaitement adapté pour le fine-tuning ou l’évaluation de modèles multimodaux combinant vision et langage.

Quelle est la taille approximative du dataset ?

Plus de 100 000 instances vidéo annotées, offrant une grande variété d’exemples pour l’entraînement et l’évaluation.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.