Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Vídeo

MSR-VTT

MSR-VTT es un conjunto de datos de vídeo para la generación automática de descripciones en lenguaje natural. Contiene 10 000 clips de vídeo que abarcan 20 categorías diferentes, cada una de ellas con 20 frases en inglés, lo que proporciona un amplio corpus para la formación y la evaluación de modelos de subtitulación de vídeos.

Obtén el dataset
Tamaño

10.000 clips de vídeo, alrededor de 200.000 frases descriptivas, formatos de vídeo habituales (mp4, avi...)

Licencia

Gratis, descarga disponible a través de Microsoft

Descripción

MSR-VTT es un gran corpus de vídeos con anotaciones para la tarea de subtitulado automático. Cada videoclip va acompañado de veinte frases en inglés que describen el contenido. Los vídeos abarcan una amplia variedad de categorías cotidianas.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos de subtitulado de vídeo en lenguaje natural
  • Evalúe la comprensión multimodal (video + texto)
  • Desarrolle asistentes inteligentes que puedan describir escenas de vídeo

¿Se puede enriquecer o mejorar?

Sí, puede agregar anotaciones adicionales, como etiquetas de acción, entidades con nombre o traducciones multilingües, para enriquecer el uso del conjunto de datos.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Medio: requiere gestión de archivos de video)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo: anotaciones bien formateadas)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno: múltiples captions por video)
📜 Licencia comercial✅ Sí (libre y gratuito)
👨‍💻 Ideal para principiantes⚠️ Medio: útil con conocimientos multimedia
🔁 Reutilizable para fine-tuning🤖 Perfecto para fine-tuning multimodal
🌍 Diversidad cultural✅ Bueno: 20 categorías variadas

🧠 Recomendado para

  • Investigadores de la visión y el lenguaje
  • Desarrolladores de IA multimodal
  • Estudiantes

🔧 Herramientas compatibles

  • PyTorch
  • TensorFlow
  • Hugging Face Transformers
  • OpenCV

💡 Consejo

Preprocese los vídeos para estandarizar el formato previo al entrenamiento.

Preguntas frecuentes

¿Cuál es la duración media de los videoclips en MSR-VTT?

Aproximadamente de 10 a 30 segundos por clip, que cubre una variedad de escenas.

¿Están todas las anotaciones en inglés?

Sí, todas las descripciones están en inglés.

¿Se puede utilizar el MSR-VTT para la traducción multimodal?

Sí, cuando se combina con conjuntos de datos de traducción, se puede usar como base para tareas multimodales y multilingües.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.