MSR-VTT
MSR-VTT est un dataset de vidéos destiné à la génération automatique de descriptions en langage naturel. Il contient 10 000 clips vidéo couvrant 20 catégories variées, chacun annoté par 20 phrases en anglais, fournissant un corpus riche pour entraîner et évaluer les modèles de captioning vidéo.
10 000 clips vidéo, environ 200 000 phrases descriptives, formats vidéo courants (mp4, avi...)
Gratuit, téléchargement accessible via Microsoft
Description
MSR-VTT est un grand corpus vidéo annoté pour la tâche de captioning automatique. Chaque clip vidéo est accompagné d’une vingtaine de phrases en anglais décrivant le contenu. Les vidéos couvrent une large variété de catégories du quotidien.
À quoi sert ce dataset ?
- Entraîner des modèles de captioning vidéo en langage naturel
- Évaluer la compréhension multimodale (vidéo + texte)
- Développer des assistants intelligents capables de décrire des scènes vidéo
Peut-on l’enrichir ou l’améliorer ?
Oui, on peut ajouter des annotations supplémentaires comme des tags d’action, des entités nommées, ou des traductions multilingues pour enrichir l’usage du dataset.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en vision et langage
- Développeurs IA multimodale
- Étudiants
🔧 Outils compatibles
- PyTorch
- TensorFlow
- Hugging Face Transformers
- OpenCV
💡 Astuce
Pré-traitez les vidéos pour uniformiser le format avant entraînement.
Questions fréquemment posées
Quelle est la durée moyenne des clips vidéo dans MSR-VTT ?
Environ 10 à 30 secondes par clip, couvrant des scènes variées.
Les annotations sont-elles toutes en anglais ?
Oui, toutes les descriptions sont en anglais.
Peut-on utiliser MSR-VTT pour la traduction multimodale ?
Oui, en combinant avec des datasets de traduction, il peut servir de base pour des tâches multimodales multilingues.




