VLMBias – Vision-Language Models Are Biased
VLMBias est un jeu d’évaluation conçu pour mettre en lumière les erreurs de raisonnement visuel causées par des biais mémorisés dans les modèles vision-langage.
Paires image-question en JSON, classées par 7 domaines (logos, animaux, jeux, illusions, etc.)
MIT
Description
VLMBias est un benchmark visuel qui vise à tester la robustesse réelle des modèles vision-langage (VLMs) face à des modifications subtiles dans des images connues. Il couvre 7 catégories : animaux, logos, drapeaux, échecs, jeux de société, illusions d’optique et grilles à motifs. Chaque image est associée à une question, souvent de type comptage ou identification d’anomalie, et certaines contiennent des leurres textuels pour exacerber les biais.
À quoi sert ce dataset ?
- Mesurer les limites cognitives des VLMs en situation de reconnaissance visuelle subtile
- Développer des modèles plus robustes au biais sémantique ou au sur-apprentissage
- Tester des systèmes de comptage, reconnaissance de motifs, ou détection de changements
Peut-on l’enrichir ou l’améliorer ?
Absolument. Il est envisageable d’ajouter de nouvelles catégories visuelles, d’augmenter le nombre de contrefactuels par domaine, ou d’ajouter d'autres types de questions (VQA, justification, etc.). Des tests multilingues ou des variantes culturelles pourraient aussi accroître sa portée.
🔎 En résumé
🧠 Recommandé pour
- Évaluateurs de VLMs
- Chercheurs en robustesse NLP/CV
- Équipes fairness/bias
🔧 Outils compatibles
- BLIP
- LLaVA
- OpenFlamingo
- CLIP
- Hugging Face Transformers
💡 Astuce
Testez vos modèles avec et sans instruction explicite pour voir si cela réduit les biais sur des images contrefactuelles.
Questions fréquemment posées
Ce dataset peut-il servir à l’entraînement ?
Il est avant tout conçu pour l’évaluation, mais certaines parties peuvent servir à l'entraînement de modèles robustes ou de détecteurs d'anomalie.
Quels types de biais sont étudiés avec ce corpus ?
Principalement les biais liés à la mémoire sémantique excessive, où le modèle privilégie ce qu’il “sait” plutôt que ce qu’il “voit”.
Les images sont-elles réalistes ou artificielles ?
Elles sont réalistes mais subtilement modifiées, ce qui les rend parfaites pour tester la perception visuelle réelle des modèles.




