CG Bench
CG-Bench es un punto de referencia diseñado para evaluar la comprensión profunda de los vídeos de formato largo a través de preguntas y respuestas basadas en pistas específicas de los vídeos.
1219 vídeos anotados manualmente, 12129 pares de preguntas y respuestas, formatos de vídeo estándar
MIT
Descripción
CG-Bench contiene 1219 vídeos largos con 12,129 pares de preguntas y respuestas, que abarcan una variedad de categorías (14 primarias, 171 secundarias y 638 terciarias). El conjunto de datos se centra en las preguntas que requieren recuperar pistas relevantes de los vídeos para evaluar la comprensión real de los modelos.
¿Para qué sirve este conjunto de datos?
- Probar y mejorar la comprensión en vídeo de modelos lingüísticos multimodales (MLLM)
- Evalúe la capacidad de los modelos para razonar sobre secuencias de vídeo largas basándose en pistas específicas
- Desarrolle sistemas robustos de preguntas y respuestas en vídeo que vayan más allá de las simples opciones múltiples
¿Se puede enriquecer o mejorar?
Sí, es posible añadir nuevas anotaciones, ampliar las categorías de vídeo o refinar las sugerencias para obtener valoraciones más detalladas. La comunidad también puede proponer datos adicionales o formatos de anotación alternativos para enriquecer el índice de referencia.
🔎 En resumen
🧠 Recomendado para
- Investigadores de visión artificial
- programadores de MLMS
- Proyectos de control de calidad de vídeo
🔧 Herramientas compatibles
- PyTorch
- TensorFlow
- Hugging Face Transformers
- Frameworks de video como OpenCV
💡 Consejo
Concéntrese en un preprocesamiento de vídeo eficaz para optimizar la velocidad durante las fases de entrenamiento.
Preguntas frecuentes
¿Este conjunto de datos está adaptado a los modelos comerciales y de código abierto?
Sí, CG-Bench compara el rendimiento de los dos tipos de modelos y está diseñado para mejorar las capacidades de ambos.
¿Las anotaciones solo incluyen preguntas de opción múltiple?
No, a diferencia de los puntos de referencia tradicionales, CG-Bench utiliza preguntas abiertas que requieren una comprensión profunda.
¿El conjunto de datos incluye vídeos de diferentes longitudes y categorías?
Sí, con más de 1200 vídeos que abarcan 14 categorías principales y múltiples subcategorías para garantizar una diversidad significativa.




