SVLA SO100 Sorting Dataset
Conjunto de datos multimodal que combina secuencias de vídeo y datos robóticos detallados de un robot SO100. Incluye vídeos HD de 30 fps, así como datos sobre la acción y el estado de los robots, lo que permite estudiar y modelar la manipulación de objetos mediante la visión y los comandos.
18 vídeos (480 x 640, 30 fps, códec AV1), 6633 fotogramas, datos de acción y observación en formato parquet
Apache 2.0
Descripción
El conjunto de datos SVLA SO100 Sorting Dataset contiene 18 vídeos HD (480 x 640, 30 fps) grabados con un robot SO100, acompañados de datos de acción (seis grados de libertad) y observación. Los datos se organizan en episodios y fragmentos con metadatos detallados.
¿Para qué sirve este conjunto de datos?
- Desarrollar y entrenar modelos de visión-lenguaje-acción en robótica.
- Analice los movimientos e interacciones robóticos para las tareas de clasificación y manipulación.
- Pruebe algoritmos de aprendizaje multimodal que integren datos de vídeo y sensores.
¿Se puede enriquecer o mejorar?
Este conjunto de datos se puede enriquecer añadiendo nuevas secuencias de vídeo, anotaciones adicionales sobre las acciones o extensiones a otros tipos de robots o tareas. La precisión de los datos de estado también se puede aumentar mediante la anotación precisa.
🔎 En resumen
🧠 Recomendado para
- Investigadores de robótica
- Desarrolladores de IA multimodal
- Equipos de I+D con visión y acción
🔧 Herramientas compatibles
- Frameworks de video (OpenCV, FFmpeg)
- Herramientas Parquet
- Bibliotecas de robótica (ROS)
💡 Consejo
Sincronice bien los datos de vídeo y sensores para un entrenamiento multimodal eficaz.
Preguntas frecuentes
¿Cuál es la resolución y el formato de los vídeos del conjunto de datos?
Los vídeos son de 480x640 píxeles, 30 fotogramas por segundo, codificados en códec AV1 sin audio.
¿Qué datos de acción se proporcionan con los vídeos?
Se capturan seis grados de libertad: movimientos de hombros, codos, muñecas y apertura de agarre.
¿Este conjunto de datos es adecuado para el aprendizaje supervisado o el refuerzo?
Principalmente para el aprendizaje supervisado multimodal, pero se puede adaptar para reforzarlo con datos adicionales.




