VIKI-R
Conjunto de datos diseñado para entrenar modelos de razonamiento visual. Combina vídeos con preguntas complejas con respuestas y explicaciones.
Descripción
VIKI-R es un conjunto de datos multimodal con más de 22 000 ejemplos, en el que cada vídeo está asociado a una instrucción, una pregunta compleja, una respuesta y una justificación. Se centra específicamente en el razonamiento multimodal en contextos dinámicos, a través de vídeos comentados. El formato Parquet permite una manipulación rápida y eficiente.
¿Para qué sirve este conjunto de datos?
- Entrene modelos que puedan responder a preguntas complejas mediante el análisis de secuencias de vídeo
- Pon a prueba la capacidad de seguir instrucciones y el razonamiento causal visual
- Evaluar modelos de video-LLM en tareas de comprensión multimodal
¿Se puede enriquecer o mejorar?
Sí, el conjunto de datos se puede enriquecer con vídeos adicionales o nuevos tipos de preguntas (por ejemplo, razonamiento espacial, temporal o inferencial). También es posible añadir anotaciones lingüísticas más precisas o audio si no están presentes.
🔎 En resumen
🧠 Recomendado para
- Desarrolladores de video-LMS
- Proyectos complejos de comprensión visual
🔧 Herramientas compatibles
- Hugging Face Transformers
- PyTorch
- Vid2Seq
- Video-LLM
- MMAction2
💡 Consejo
Para obtener mejores resultados, estandarice la duración de los vídeos previos al entrenamiento y preprocese los fotogramas clave.
Preguntas frecuentes
¿Este conjunto de datos contiene cuadros de diálogo?
No, contiene instrucciones, preguntas, respuestas y justificaciones, pero no un diálogo entre los agentes.
¿Los vídeos se incluyen directamente en el conjunto de datos?
No, solo se incluyen los metadatos y las anotaciones. Se hace referencia a los vídeos, pero se deben obtener por separado si es necesario.
¿Se puede usar para tareas de clasificación sencillas?
Este no es su objetivo principal, pero se puede adaptar para ello simplificando las tareas en función de las anotaciones proporcionadas.




