WM-ABench
WM-Abench es un punto de referencia destinado a probar la comprensión precisa de los modelos del lenguaje visual sobre el modelado de la dinámica física a través de vídeos simulados. Abarca 23 dimensiones diferentes de la modelización del mundo, con tareas complejas de percepción y predicción.
Más de 100 000 secuencias de vídeo comentadas con preguntas de opción múltiple de 6 simuladores físicos
Apache 2.0
Descripción
El conjunto de datos WM-ABench contiene más de 100 000 instancias de vídeo de 6 entornos de simulación física. Cada ejemplo incluye secuencias de vídeo que muestran las interacciones entre objetos, acompañadas de preguntas de respuesta múltiple con opciones similares pero incorrectas, con el fin de evaluar la comprensión física real de los modelos de lenguaje visual.
¿Para qué sirve este conjunto de datos?
- Evaluar las capacidades de percepción espacial, temporal y material de los modelos de lenguaje visual
- Pon a prueba la capacidad de predecir la dinámica física (caídas, colisiones, acciones complejas)
- Sirven de base para el ajuste o la validación de modelos avanzados en visión y lenguaje multimodal
¿Se puede enriquecer o mejorar?
Sí, es posible añadir anotaciones adicionales, como metadatos de objetos más precisos, etiquetas de complejidad o introducir nuevas escenas simuladas. El conjunto de datos también se puede ampliar mezclándolo o combinándolo con otros puntos de referencia de vídeo para mejorar la diversidad.
🔎 En resumen
🧠 Recomendado para
- Investigadores de visión artificial
- Desarrolladores de modelos multimodales
- Equipos de IA en robótica
🔧 Herramientas compatibles
- Hugging Face Datasets
- PyTorch
- TensorFlow
- Simuladores físicos compatibles
💡 Consejo
Usa los subconjuntos más pequeños para realizar pruebas rápidas antes de comenzar el entrenamiento completo.
Preguntas frecuentes
¿Qué tipo de preguntas se hacen a las modelos en WM-Abench?
Preguntas de opción múltiple relacionadas con la percepción visual y la predicción de la dinámica física en escenas simuladas.
¿Se puede usar este conjunto de datos para ajustar los modelos del lenguaje de visión?
Sí, es perfectamente adecuado para ajustar o evaluar modelos multimodales que combinan visión y lenguaje.
¿Cuál es el tamaño aproximado del conjunto de datos?
Más de 100 000 instancias de vídeo con anotaciones, que ofrecen una amplia variedad de ejemplos para la formación y la evaluación.




