Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
WM-ABench
Vídeo

WM-ABench

WM-Abench es un punto de referencia destinado a probar la comprensión precisa de los modelos del lenguaje visual sobre el modelado de la dinámica física a través de vídeos simulados. Abarca 23 dimensiones diferentes de la modelización del mundo, con tareas complejas de percepción y predicción.

Obtén el dataset
Tamaño

Más de 100 000 secuencias de vídeo comentadas con preguntas de opción múltiple de 6 simuladores físicos

Licencia

Apache 2.0

Descripción

El conjunto de datos WM-ABench contiene más de 100 000 instancias de vídeo de 6 entornos de simulación física. Cada ejemplo incluye secuencias de vídeo que muestran las interacciones entre objetos, acompañadas de preguntas de respuesta múltiple con opciones similares pero incorrectas, con el fin de evaluar la comprensión física real de los modelos de lenguaje visual.

¿Para qué sirve este conjunto de datos?

  • Evaluar las capacidades de percepción espacial, temporal y material de los modelos de lenguaje visual
  • Pon a prueba la capacidad de predecir la dinámica física (caídas, colisiones, acciones complejas)
  • Sirven de base para el ajuste o la validación de modelos avanzados en visión y lenguaje multimodal

¿Se puede enriquecer o mejorar?

Sí, es posible añadir anotaciones adicionales, como metadatos de objetos más precisos, etiquetas de complejidad o introducir nuevas escenas simuladas. El conjunto de datos también se puede ampliar mezclándolo o combinándolo con otros puntos de referencia de vídeo para mejorar la diversidad.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Formato estándar con API disponible, requiere conocimientos en multimedia)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos simulados y bien estructurados)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Excelente – preguntas de opción múltiple con "hard negatives" para evaluación fina)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes⚠️ Moderado – mejor con experiencia en visión por computadora y NLP
🔁 Reutilizable para fine-tuning🎯 Perfecto para fine-tuning de modelos visión-lenguaje multimodales
🌍 Diversidad cultural⚠️ Limitado – dataset centrado en simulaciones físicas, pocos elementos culturales

🧠 Recomendado para

  • Investigadores de visión artificial
  • Desarrolladores de modelos multimodales
  • Equipos de IA en robótica

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • PyTorch
  • TensorFlow
  • Simuladores físicos compatibles

💡 Consejo

Usa los subconjuntos más pequeños para realizar pruebas rápidas antes de comenzar el entrenamiento completo.

Preguntas frecuentes

¿Qué tipo de preguntas se hacen a las modelos en WM-Abench?

Preguntas de opción múltiple relacionadas con la percepción visual y la predicción de la dinámica física en escenas simuladas.

¿Se puede usar este conjunto de datos para ajustar los modelos del lenguaje de visión?

Sí, es perfectamente adecuado para ajustar o evaluar modelos multimodales que combinan visión y lenguaje.

¿Cuál es el tamaño aproximado del conjunto de datos?

Más de 100 000 instancias de vídeo con anotaciones, que ofrecen una amplia variedad de ejemplos para la formación y la evaluación.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.