VIKI-R
Dataset conçu pour l'entraînement de modèles de raisonnement visuel. Il associe des vidéos à des questions complexes avec réponses et explications.
Description
VIKI-R est un jeu de données multimodal comprenant plus de 22 000 exemples, où chaque vidéo est associée à une instruction, une question complexe, une réponse et une justification. Il cible spécifiquement le raisonnement multimodal dans des contextes dynamiques, via des vidéos annotées. Le format Parquet permet une manipulation efficace et rapide.
À quoi sert ce dataset ?
- Former des modèles capables de répondre à des questions complexes en analysant des séquences vidéo
- Tester la capacité de suivi d’instructions et de raisonnement causal visuel
- Évaluer des modèles de type Video-LLM sur des tâches de compréhension multimodale
Peut-on l’enrichir ou l’améliorer ?
Oui, le dataset peut être enrichi avec des vidéos supplémentaires ou de nouveaux types de questions (ex : raisonnement spatial, temporal, inférentiel). Il est également possible d’ajouter des annotations linguistiques plus fines ou de l'audio si non présent.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en IA multimodale
- Développeurs de Video-LLMs
- Projets de compréhension visuelle complexe
🔧 Outils compatibles
- Hugging Face Transformers
- PyTorch
- Vid2Seq
- Video-LLM
- MMAction2
💡 Astuce
Pour de meilleurs résultats, normalisez les durées des vidéos avant entraînement, et prétraitez les frames clés.
Questions fréquemment posées
Ce dataset contient-il des dialogues ?
Non, il contient des instructions, des questions, des réponses et des justifications, mais pas de dialogue entre agents.
Les vidéos sont-elles directement incluses dans le dataset ?
Non, seules les métadonnées et annotations sont incluses. Les vidéos sont référencées mais doivent être obtenues séparément si besoin.
Peut-on l’utiliser pour des tâches de classification simple ?
Ce n’est pas sa vocation première, mais il peut être adapté pour cela en simplifiant les tâches à partir des annotations fournies.




