En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Multimodal

VIKI-R

Dataset conçu pour l'entraînement de modèles de raisonnement visuel. Il associe des vidéos à des questions complexes avec réponses et explications.

Télécharger le dataset
Taille

22 637 exemples, 813 Mo, format Parquet

Licence

Apache 2.0

Description

‍

VIKI-R est un jeu de données multimodal comprenant plus de 22 000 exemples, où chaque vidéo est associée à une instruction, une question complexe, une réponse et une justification. Il cible spécifiquement le raisonnement multimodal dans des contextes dynamiques, via des vidéos annotées. Le format Parquet permet une manipulation efficace et rapide.

‍

‍

À quoi sert ce dataset ?

‍

  • Former des modèles capables de répondre à des questions complexes en analysant des séquences vidéo
  • Tester la capacité de suivi d’instructions et de raisonnement causal visuel
  • Évaluer des modèles de type Video-LLM sur des tâches de compréhension multimodale

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, le dataset peut être enrichi avec des vidéos supplémentaires ou de nouveaux types de questions (ex : raisonnement spatial, temporal, inférentiel). Il est également possible d’ajouter des annotations linguistiques plus fines ou de l'audio si non présent.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Facile à charger et bien structuré)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Aucun besoin majeur)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Inclut réponse + justification)
📜 Licence commerciale✅ Oui (Apache 2.0)
👨‍💻 Idéal pour les débutants⚠️ Mieux pour utilisateurs ayant des bases en vision multimodale
🔁 Réutilisable en fine-tuning🎯 Oui, pour VideoQA et reasoning
🌍 Diversité culturelle⚠️ Moyenne – dépend du contenu vidéo

‍

‍

🧠 Recommandé pour

  • Chercheurs en IA multimodale
  • Développeurs de Video-LLMs
  • Projets de compréhension visuelle complexe

‍

‍

🔧 Outils compatibles

  • Hugging Face Transformers
  • PyTorch
  • Vid2Seq
  • Video-LLM
  • MMAction2

‍

‍

💡 Astuce

Pour de meilleurs résultats, normalisez les durées des vidéos avant entraînement, et prétraitez les frames clés.

Questions fréquemment posées

Ce dataset contient-il des dialogues ?

Non, il contient des instructions, des questions, des réponses et des justifications, mais pas de dialogue entre agents.

Les vidéos sont-elles directement incluses dans le dataset ?

Non, seules les métadonnées et annotations sont incluses. Les vidéos sont référencées mais doivent être obtenues séparément si besoin.

Peut-on l’utiliser pour des tâches de classification simple ?

Ce n’est pas sa vocation première, mais il peut être adapté pour cela en simplifiant les tâches à partir des annotations fournies.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.