Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Multimodal

VIKI-R

Conjunto de datos diseñado para entrenar modelos de razonamiento visual. Combina vídeos con preguntas complejas con respuestas y explicaciones.

Obtén el dataset
Tamaño

22.637 ejemplos, 813 MB, formato Parquet

Licencia

Apache 2.0

Descripción

‍

VIKI-R es un conjunto de datos multimodal con más de 22 000 ejemplos, en el que cada vídeo está asociado a una instrucción, una pregunta compleja, una respuesta y una justificación. Se centra específicamente en el razonamiento multimodal en contextos dinámicos, a través de vídeos comentados. El formato Parquet permite una manipulación rápida y eficiente.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos que puedan responder a preguntas complejas mediante el análisis de secuencias de vídeo
  • Pon a prueba la capacidad de seguir instrucciones y el razonamiento causal visual
  • Evaluar modelos de video-LLM en tareas de comprensión multimodal

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, el conjunto de datos se puede enriquecer con vídeos adicionales o nuevos tipos de preguntas (por ejemplo, razonamiento espacial, temporal o inferencial). También es posible añadir anotaciones lingüísticas más precisas o audio si no están presentes.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Fácil de cargar y bien estructurado)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ninguna necesidad mayor)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Incluye respuesta + justificación)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes⚠️ Mejor para usuarios con bases en visión multimodal
🔁 Reutilizable para fine-tuning🎯 Sí, para VideoQA y razonamiento
🌍 Diversidad cultural⚠️ Moderado – depende del contenido del video

‍

‍

🧠 Recomendado para

  • Desarrolladores de video-LMS
  • Proyectos complejos de comprensión visual

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • PyTorch
  • Vid2Seq
  • Video-LLM
  • MMAction2

‍

‍

💡 Consejo

Para obtener mejores resultados, estandarice la duración de los vídeos previos al entrenamiento y preprocese los fotogramas clave.

Preguntas frecuentes

¿Este conjunto de datos contiene cuadros de diálogo?

No, contiene instrucciones, preguntas, respuestas y justificaciones, pero no un diálogo entre los agentes.

¿Los vídeos se incluyen directamente en el conjunto de datos?

No, solo se incluyen los metadatos y las anotaciones. Se hace referencia a los vídeos, pero se deben obtener por separado si es necesario.

¿Se puede usar para tareas de clasificación sencillas?

Este no es su objetivo principal, pero se puede adaptar para ello simplificando las tareas en función de las anotaciones proporcionadas.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.