Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
VLMbias: los modelos del lenguaje de visión están sesgados
Imagen

VLMbias: los modelos del lenguaje de visión están sesgados

VLMbias es un juego de evaluación diseñado para resaltar los errores de razonamiento visual causados por sesgos almacenados en modelos de lenguaje visual.

Obtén el dataset
Tamaño

Pares de imágenes y preguntas en JSON, clasificados en 7 dominios (logotipos, animales, juegos, ilusiones, etc.)

Licencia

MIT

Descripción

VLMbias es un punto de referencia visual que tiene como objetivo probar la solidez real de los modelos de lenguaje de visión (VLM) frente a las sutiles modificaciones en las imágenes conocidas. Abarca 7 categorías: animales, logotipos, banderas, banderas, ajedrez, juegos de mesa, ilusiones ópticas y cuadrículas estampadas. Cada imagen está asociada a una pregunta y, a menudo, cuenta o identifica anomalías, y algunas contienen señuelos textuales para agravar los sesgos.

¿Para qué sirve este conjunto de datos?

  • Medición de los límites cognitivos de los VLM en situaciones de reconocimiento visual sutil
  • Desarrolle modelos que sean más resistentes al sesgo semántico o al sobreaprendizaje
  • Sistemas de recuento de pruebas, reconocimiento de patrones o detección de cambios

¿Se puede enriquecer o mejorar?

Absolutamente. Es posible añadir nuevas categorías visuales, aumentar el número de contrafácticos por dominio o añadir otro tipo de preguntas (VQA, justificación, etc.). Las pruebas multilingües o las variantes culturales también podrían aumentar su alcance.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Moderado – requiere emparejamiento imagen-pregunta)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ninguno: datos listos para evaluación)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Buen nivel: preguntas focalizadas, contrafactuales variados)
📜 Licencia comercial✅ Sí (MIT)
👨‍💻 Ideal para principiantes🌟 Sí, perfecto para probar VLMs sin fine-tuning
🔁 Reutilizable para fine-tuning⚠️ Limitado: útil sobre todo para test/evaluación
🌍 Diversidad cultural⚠️ Moderado: objetos comunes, principalmente occidentales

🧠 Recomendado para

  • Evaluadores del VLM
  • Investigadores de solidez de NLP/CV
  • Equipos de imparcialidad y parcialidad

🔧 Herramientas compatibles

  • BLIP
  • LLaVA
  • OpenFlamingo
  • CLIP
  • Hugging Face Transformers

💡 Consejo

Pruebe sus modelos con y sin instrucciones explícitas para ver si esto reduce el sesgo en las imágenes contrafácticas.

Preguntas frecuentes

¿Se puede usar este conjunto de datos para la capacitación?

Está diseñado principalmente para la evaluación, pero algunas partes se pueden usar para entrenar modelos robustos o detectores de anomalías.

¿Qué tipos de sesgos se estudian con este corpus?

Principalmente los sesgos asociados al exceso de memoria semántica, donde el modelo favorece lo que «sabe» en lugar de lo que «ve».

¿Las imágenes son realistas o artificiales?

Son realistas pero están sutilmente modificadas, lo que las hace perfectas para probar la percepción visual real de los modelos.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.