Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
SVLA SO100 Sorting Dataset
Vídeo

SVLA SO100 Sorting Dataset

Conjunto de datos multimodal que combina secuencias de vídeo y datos robóticos detallados de un robot SO100. Incluye vídeos HD de 30 fps, así como datos sobre la acción y el estado de los robots, lo que permite estudiar y modelar la manipulación de objetos mediante la visión y los comandos.

Obtén el dataset
Tamaño

18 vídeos (480 x 640, 30 fps, códec AV1), 6633 fotogramas, datos de acción y observación en formato parquet

Licencia

Apache 2.0

Descripción

El conjunto de datos SVLA SO100 Sorting Dataset contiene 18 vídeos HD (480 x 640, 30 fps) grabados con un robot SO100, acompañados de datos de acción (seis grados de libertad) y observación. Los datos se organizan en episodios y fragmentos con metadatos detallados.

¿Para qué sirve este conjunto de datos?

  • Desarrollar y entrenar modelos de visión-lenguaje-acción en robótica.
  • Analice los movimientos e interacciones robóticos para las tareas de clasificación y manipulación.
  • Pruebe algoritmos de aprendizaje multimodal que integren datos de vídeo y sensores.

¿Se puede enriquecer o mejorar?

Este conjunto de datos se puede enriquecer añadiendo nuevas secuencias de vídeo, anotaciones adicionales sobre las acciones o extensiones a otros tipos de robots o tareas. La precisión de los datos de estado también se puede aumentar mediante la anotación precisa.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Requiere procesamiento de video y datos de sensores en parquet)
🧼 Necesidad de limpieza⭐⭐⭐⭐✩ (Moderado – formato estructurado pero multiformato a gestionar)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno – datos de acciones detalladas y metadatos)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes⚠️ Moderado – formato de video y sensores a dominar
🔁 Reutilizable para fine-tuning🎯 Adecuado para aprendizaje multimodal en robótica
🌍 Diversidad cultural⚖️ Contenido técnico sin sesgo cultural notable

🧠 Recomendado para

  • Investigadores de robótica
  • Desarrolladores de IA multimodal
  • Equipos de I+D con visión y acción

🔧 Herramientas compatibles

  • Frameworks de video (OpenCV, FFmpeg)
  • Herramientas Parquet
  • Bibliotecas de robótica (ROS)

💡 Consejo

Sincronice bien los datos de vídeo y sensores para un entrenamiento multimodal eficaz.

Preguntas frecuentes

¿Cuál es la resolución y el formato de los vídeos del conjunto de datos?

Los vídeos son de 480x640 píxeles, 30 fotogramas por segundo, codificados en códec AV1 sin audio.

¿Qué datos de acción se proporcionan con los vídeos?

Se capturan seis grados de libertad: movimientos de hombros, codos, muñecas y apertura de agarre.

¿Este conjunto de datos es adecuado para el aprendizaje supervisado o el refuerzo?

Principalmente para el aprendizaje supervisado multimodal, pero se puede adaptar para reforzarlo con datos adicionales.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.