HaGrid: conjunto de datos de imágenes de reconocimiento de gestos con las manos
Conjunto de datos masivo de imágenes de gestos con las manos (552 992 muestras), dividido en 18 clases, con anotaciones precisas para la detección y el seguimiento.
552.992 imágenes Full HD anotadas en COCO + 21 puntos de referencia, 18 clases
CC BY-SA 4.0
Descripción
HaGrid es un amplio conjunto de datos de reconocimiento de gestos con las manos, compuesto por más de 550.000 imágenes en Full HD capturadas en diversas condiciones (luz natural, luz artificial, luz de fondo, etc.). Incluye 18 clases de gestos, así como una clase «no_gesture» para el ruido. Las imágenes van acompañadas de anotaciones COCO (recuadros delimitadores), 21 puntos de referencia e información adicional en la parte principal.
¿Para qué sirve este conjunto de datos?
- Entrene modelos de reconocimiento de gestos para videoconferencias (Zoom, Skype...)
- Desarrollar interfaces gestuales en el sector de la automoción o la domótica
- Algoritmos de prueba para detectar la mano y rastrear movimientos precisos
¿Se puede enriquecer o mejorar?
Sí, el conjunto de datos se puede adaptar a casos de uso específicos filtrando determinadas clases o complementándolo con vídeos. También es posible mejorar la diversidad añadiendo otras poblaciones o contextos culturales. Las anotaciones también se pueden refinar para tareas de segmentación o clasificación con múltiples manos.
🔎 En resumen
🧠 Recomendado para
- Investigadores de visión artificial
- Desarrolladores de HCI
- Proyectos de interacción gestual
🔧 Herramientas compatibles
- Detectron2
- YOLOv5
- MediaPipe
- Tensorflow Object Detection API
💡 Consejo
Utilice identificadores de usuario para evitar la filtración de datos entre el entrenamiento y la prueba durante la validación cruzada.
Preguntas frecuentes
¿Este conjunto de datos contiene vídeos o solo imágenes?
Solo contiene imágenes en Full HD, pero con una amplia gama de poses y gestos que simulan una secuencia.
¿Los gestos están anotados con precisión?
Sí, cada mano está anotada con un recuadro delimitador, 21 puntos de referencia y metadatos sobre la mano principal y la confianza.
¿Es adecuado para entrenar modelos en tiempo real?
Sí, al extraer subconjuntos o cambiar el tamaño de las imágenes, se puede usar para aplicaciones integradas o en tiempo real.




