HaGRID – Hand Gesture Recognition Image Dataset
Jeu de données massif d’images de gestes de la main (552 992 échantillons), réparties en 18 classes, avec annotations précises pour la détection et le suivi.
552 992 images Full HD annotées en COCO + 21 points landmarks, 18 classes
CC BY-SA 4.0
Description
HaGRID est un vaste dataset de reconnaissance de gestes de la main, composé de plus de 550 000 images Full HD capturées dans des conditions variées (lumière naturelle, artificielle, contre-jour…). Il couvre 18 classes de gestes ainsi qu’une classe « no_gesture » pour le bruit. Les images sont accompagnées d’annotations COCO (bounding boxes), de 21 points de repère (landmarks), et d’informations supplémentaires sur la main principale.
À quoi sert ce dataset ?
- Entraîner des modèles de reconnaissance de gestes pour la visioconférence (Zoom, Skype…)
- Développer des interfaces gestuelles dans le secteur automobile ou la domotique
- Tester des algorithmes de détection de la main et suivi de mouvements précis
Peut-on l’enrichir ou l’améliorer ?
Oui, le dataset peut être adapté à des cas d’usage spécifiques en filtrant certaines classes ou en complétant avec des vidéos. Il est également possible d’améliorer la diversité en ajoutant d’autres populations ou contextes culturels. Les annotations peuvent aussi être affinées pour des tâches de segmentation ou classification multi-mains.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en vision par ordinateur
- Développeurs HCI
- Projets en interaction gestuelle
🔧 Outils compatibles
- Detectron2
- YOLOv5
- MediaPipe
- Tensorflow Object Detection API
💡 Astuce
Utilisez les identifiants utilisateurs pour éviter le data leakage entre train et test lors de la validation croisée.
Questions fréquemment posées
Ce dataset contient-il des vidéos ou uniquement des images ?
Il contient uniquement des images Full HD, mais avec un large éventail de poses et de gestes simulant une séquence.
Les gestes sont-ils annotés avec précision ?
Oui, chaque main est annotée avec une bounding box, 21 landmarks, et des métadonnées sur la main principale et la confiance.
Est-il adapté à l'entraînement de modèles en temps réel ?
Oui, en extrayant des sous-ensembles ou en redimensionnant les images, il peut servir à des applications embarquées ou temps réel.




