StreamVLN Trajectory Data
Dataset contenant des observations visuelles (images RGB) et des annotations d’actions collectées dans un simulateur pour des tâches de navigation vision-langage dans Matterport3D.
Plusieurs milliers d’images RGB et annotations JSON de trajectoires, répartis sur plusieurs sous-datasets
CC BY-SA 4.0
Description
StreamVLN Trajectory Data regroupe des images RGB et des annotations détaillées d’actions dans des environnements simulés Matterport3D. Il combine plusieurs datasets open-source de navigation Vision-and-Language, facilitant ainsi l’apprentissage de trajectoires guidées par des instructions textuelles.
À quoi sert ce dataset ?
- Entraîner des modèles de navigation autonome en vision-langage
- Évaluer des agents capables de suivre des instructions dans des environnements simulés
- Développer des systèmes multimodaux combinant vision et langage pour la robotique
Peut-on l’enrichir ou l’améliorer ?
Ce dataset peut être enrichi par l’ajout de vidéos des trajectoires, des annotations plus fines sur l’environnement, ou des données sensorimotrices complémentaires issues du simulateur.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en robotique
- Développeurs IA multimodale
- Ingénieurs simulation
🔧 Outils compatibles
- Habitat simulator
- PyTorch
- TensorFlow
- VLN frameworks
💡 Astuce
Utilisez les annotations pour entraîner des agents à suivre précisément des instructions dans des environnements 3D simulés.
Questions fréquemment posées
Quelles données sont incluses dans ce dataset ?
Des images RGB et des séquences d’actions annotées dans des environnements simulés Matterport3D pour la navigation.
Ce dataset peut-il être utilisé pour la navigation autonome dans le monde réel ?
Indirectement, il sert surtout à entraîner et évaluer des modèles en simulation, mais peut servir de base pour transfert vers le réel.
Comment sont structurées les annotations ?
Les annotations sont en JSON et décrivent les instructions de navigation et la séquence d’actions discrètes correspondant aux images.




