VLMbias: los modelos del lenguaje de visión están sesgados
VLMbias es un juego de evaluación diseñado para resaltar los errores de razonamiento visual causados por sesgos almacenados en modelos de lenguaje visual.
Pares de imágenes y preguntas en JSON, clasificados en 7 dominios (logotipos, animales, juegos, ilusiones, etc.)
MIT
Descripción
VLMbias es un punto de referencia visual que tiene como objetivo probar la solidez real de los modelos de lenguaje de visión (VLM) frente a las sutiles modificaciones en las imágenes conocidas. Abarca 7 categorías: animales, logotipos, banderas, banderas, ajedrez, juegos de mesa, ilusiones ópticas y cuadrículas estampadas. Cada imagen está asociada a una pregunta y, a menudo, cuenta o identifica anomalías, y algunas contienen señuelos textuales para agravar los sesgos.
¿Para qué sirve este conjunto de datos?
- Medición de los límites cognitivos de los VLM en situaciones de reconocimiento visual sutil
- Desarrolle modelos que sean más resistentes al sesgo semántico o al sobreaprendizaje
- Sistemas de recuento de pruebas, reconocimiento de patrones o detección de cambios
¿Se puede enriquecer o mejorar?
Absolutamente. Es posible añadir nuevas categorías visuales, aumentar el número de contrafácticos por dominio o añadir otro tipo de preguntas (VQA, justificación, etc.). Las pruebas multilingües o las variantes culturales también podrían aumentar su alcance.
🔎 En resumen
🧠 Recomendado para
- Evaluadores del VLM
- Investigadores de solidez de NLP/CV
- Equipos de imparcialidad y parcialidad
🔧 Herramientas compatibles
- BLIP
- LLaVA
- OpenFlamingo
- CLIP
- Hugging Face Transformers
💡 Consejo
Pruebe sus modelos con y sin instrucciones explícitas para ver si esto reduce el sesgo en las imágenes contrafácticas.
Preguntas frecuentes
¿Se puede usar este conjunto de datos para la capacitación?
Está diseñado principalmente para la evaluación, pero algunas partes se pueden usar para entrenar modelos robustos o detectores de anomalías.
¿Qué tipos de sesgos se estudian con este corpus?
Principalmente los sesgos asociados al exceso de memoria semántica, donde el modelo favorece lo que «sabe» en lugar de lo que «ve».
¿Las imágenes son realistas o artificiales?
Son realistas pero están sutilmente modificadas, lo que las hace perfectas para probar la percepción visual real de los modelos.




