En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Video

MSR-VTT

MSR-VTT est un dataset de vidéos destiné à la génération automatique de descriptions en langage naturel. Il contient 10 000 clips vidéo couvrant 20 catégories variées, chacun annoté par 20 phrases en anglais, fournissant un corpus riche pour entraîner et évaluer les modèles de captioning vidéo.

Télécharger le dataset
Taille

10 000 clips vidéo, environ 200 000 phrases descriptives, formats vidéo courants (mp4, avi...)

Licence

Gratuit, téléchargement accessible via Microsoft

Description

MSR-VTT est un grand corpus vidéo annoté pour la tâche de captioning automatique. Chaque clip vidéo est accompagné d’une vingtaine de phrases en anglais décrivant le contenu. Les vidéos couvrent une large variété de catégories du quotidien.

À quoi sert ce dataset ?

  • Entraîner des modèles de captioning vidéo en langage naturel
  • Évaluer la compréhension multimodale (vidéo + texte)
  • Développer des assistants intelligents capables de décrire des scènes vidéo

Peut-on l’enrichir ou l’améliorer ?

Oui, on peut ajouter des annotations supplémentaires comme des tags d’action, des entités nommées, ou des traductions multilingues pour enrichir l’usage du dataset.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Moyenne : nécessite gestion de fichiers vidéo)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible : annotations bien formatées)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne : multiples captions par vidéo)
📜 Licence commerciale✅ Oui (libre et gratuite)
👨‍💻 Idéal pour les débutants⚠️ Moyen : utile avec des compétences multimédia
🔁 Réutilisable en fine-tuning🤖 Parfait pour fine-tuning multimodal
🌍 Diversité culturelle✅ Bonne : 20 catégories variées

🧠 Recommandé pour

  • Chercheurs en vision et langage
  • Développeurs IA multimodale
  • Étudiants

🔧 Outils compatibles

  • PyTorch
  • TensorFlow
  • Hugging Face Transformers
  • OpenCV

💡 Astuce

Pré-traitez les vidéos pour uniformiser le format avant entraînement.

Questions fréquemment posées

Quelle est la durée moyenne des clips vidéo dans MSR-VTT ?

Environ 10 à 30 secondes par clip, couvrant des scènes variées.

Les annotations sont-elles toutes en anglais ?

Oui, toutes les descriptions sont en anglais.

Peut-on utiliser MSR-VTT pour la traduction multimodale ?

Oui, en combinant avec des datasets de traduction, il peut servir de base pour des tâches multimodales multilingues.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.