MSR-VTT
MSR-VTT es un conjunto de datos de vídeo para la generación automática de descripciones en lenguaje natural. Contiene 10 000 clips de vídeo que abarcan 20 categorías diferentes, cada una de ellas con 20 frases en inglés, lo que proporciona un amplio corpus para la formación y la evaluación de modelos de subtitulación de vídeos.
10.000 clips de vídeo, alrededor de 200.000 frases descriptivas, formatos de vídeo habituales (mp4, avi...)
Gratis, descarga disponible a través de Microsoft
Descripción
MSR-VTT es un gran corpus de vídeos con anotaciones para la tarea de subtitulado automático. Cada videoclip va acompañado de veinte frases en inglés que describen el contenido. Los vídeos abarcan una amplia variedad de categorías cotidianas.
¿Para qué sirve este conjunto de datos?
- Entrene modelos de subtitulado de vídeo en lenguaje natural
- Evalúe la comprensión multimodal (video + texto)
- Desarrolle asistentes inteligentes que puedan describir escenas de vídeo
¿Se puede enriquecer o mejorar?
Sí, puede agregar anotaciones adicionales, como etiquetas de acción, entidades con nombre o traducciones multilingües, para enriquecer el uso del conjunto de datos.
🔎 En resumen
🧠 Recomendado para
- Investigadores de la visión y el lenguaje
- Desarrolladores de IA multimodal
- Estudiantes
🔧 Herramientas compatibles
- PyTorch
- TensorFlow
- Hugging Face Transformers
- OpenCV
💡 Consejo
Preprocese los vídeos para estandarizar el formato previo al entrenamiento.
Preguntas frecuentes
¿Cuál es la duración media de los videoclips en MSR-VTT?
Aproximadamente de 10 a 30 segundos por clip, que cubre una variedad de escenas.
¿Están todas las anotaciones en inglés?
Sí, todas las descripciones están en inglés.
¿Se puede utilizar el MSR-VTT para la traducción multimodal?
Sí, cuando se combina con conjuntos de datos de traducción, se puede usar como base para tareas multimodales y multilingües.




