Scientists' First Exam – Évaluation cognitive des MLLMs
Benchmark conçu pour tester la perception, la compréhension et le raisonnement scientifique des MLLMs, à travers des tâches couvrant 5 disciplines.
66 tâches multimodales en VQA scientifique (images + questions), format JSON et fichiers visuels
MIT
Description
Scientists’ First Exam (SFE) est un benchmark de haute qualité destiné à évaluer les capacités cognitives scientifiques des modèles de langage multimodaux (MLLMs). Il comprend 66 tâches couvrant cinq disciplines : astronomie, chimie, sciences de la Terre, sciences de la vie et science des matériaux. Chaque tâche combine des données visuelles scientifiques (graphiques, images expérimentales, etc.) avec des paires de questions-réponses formulées pour tester la perception, la compréhension et le raisonnement.
À quoi sert ce dataset ?
- Évaluer la capacité des MLLMs à interpréter des données scientifiques complexes
- Tester différentes couches de raisonnement scientifique dans des contextes réels
- Fournir un benchmark standardisé pour la recherche en cognition artificielle
Peut-on l’enrichir ou l’améliorer ?
Oui, SFE peut être enrichi en ajoutant de nouvelles disciplines ou en traduisant les paires de questions en d’autres langues. Les chercheurs peuvent également créer des variantes des tâches avec différents niveaux de complexité ou fournir des notations humaines pour mieux calibrer les résultats d’évaluation.
🔎 En résumé
🧠 Recommandé pour
- Laboratoires de recherche IA
- Développeurs de MLLMs
- Projets de cognition IA
🔧 Outils compatibles
- Hugging Face
- Lmms-eval
- PyTorch
- Gradio
💡 Astuce
Pour affiner vos modèles, commencez par les tâches de perception avant d’aborder le raisonnement comparatif.
Questions fréquemment posées
Ce benchmark peut-il être utilisé pour entraîner des modèles IA ?
Le dataset est conçu pour l’évaluation, mais peut être adapté au fine-tuning pour des tâches spécifiques de VQA scientifique.
En quelles langues les tâches sont-elles disponibles ?
Toutes les tâches sont disponibles en anglais et en chinois, ce qui favorise une évaluation multilingue des modèles.
Est-il nécessaire d’avoir une expertise scientifique pour exploiter ce dataset ?
Oui, certaines tâches demandent une bonne compréhension des disciplines scientifiques concernées pour une évaluation pertinente.




