En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
LEMONADE – Évaluation du langage sur vidéo egocentrique
Video

LEMONADE – Évaluation du langage sur vidéo egocentrique

LEMONADE est un benchmark composé de questions fermées associées à des clips vidéo egocentriques enregistrés en cuisine, permettant d’évaluer la compréhension du comportement, le raisonnement temporel et l’analyse biomécanique.

Télécharger le dataset
Taille

36 521 Q/A, 30 vidéos MP4, format CSV pour Q/A

Licence

MIT

Description

Le dataset LEMONADE comprend 36 521 questions-réponses fermées liées à des vidéos egocentriques issues du benchmark EPFL-Smart-Kitchen-30. Les questions couvrent trois grandes catégories : compréhension comportementale, compréhension longue durée, et analyse biomécanique via estimation 3D des poses.

À quoi sert ce dataset ?

  • Évaluer la compréhension vidéo des modèles de langage multimodal
  • Tester le raisonnement temporel et l’inférence sur des séquences vidéo longues
  • Analyser des données biomécaniques à partir de la vidéo (postures, mouvements)

Peut-on l’enrichir ou l’améliorer ?

Oui. On peut envisager d’ajouter d’autres modalités comme des données capteurs, des annotations plus fines du comportement, ou des transcriptions textuelles enrichies. L’intégration avec d’autres benchmarks vidéos peut aussi enrichir l’écosystème.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Bon, données bien structurées, scripts disponibles)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Minimal, données prêtes à l’emploi)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Denses et diversifiées, couvrant plusieurs aspects du comportement)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants⚠️ Moyen – nécessite compréhension multimodale vidéo
🔁 Réutilisable en fine-tuning🎯 Oui, adapté à l’entraînement de modèles multimodaux
🌍 Diversité culturelle⚠️ Limité géographiquement (EPFL), à compléter éventuellement

🧠 Recommandé pour

  • Chercheurs en vision-langage
  • Développeurs de modèles vidéo multimodaux
  • Équipes R&D en biomécanique

🔧 Outils compatibles

  • PyTorch
  • Hugging Face Transformers
  • MMAction2
  • OpenPose
  • Notebooks multimodaux

💡 Astuce

Combinez ce dataset avec des annotations comportementales additionnelles pour enrichir la compréhension contextuelle.

Questions fréquemment posées

Quelles sont les principales catégories de questions dans LEMONADE ?

Les questions sont classées en trois grandes catégories : compréhension du comportement, compréhension à long terme, et analyse biomécanique.

Peut-on utiliser ce dataset pour entraîner un modèle multimodal ?

Oui, il est adapté à l’entraînement et à l’évaluation de modèles combinant vidéo et langage.

Quelles sont les modalités de données présentes dans ce dataset ?

Le dataset inclut des vidéos egocentriques au format MP4 et des questions-réponses associées sous forme de fichier CSV.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.