En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Scientists' First Exam – Évaluation cognitive des MLLMs
Multimodal

Scientists' First Exam – Évaluation cognitive des MLLMs

Benchmark conçu pour tester la perception, la compréhension et le raisonnement scientifique des MLLMs, à travers des tâches couvrant 5 disciplines.

Télécharger le dataset
Taille

66 tâches multimodales en VQA scientifique (images + questions), format JSON et fichiers visuels

Licence

MIT

Description

Scientists’ First Exam (SFE) est un benchmark de haute qualité destiné à évaluer les capacités cognitives scientifiques des modèles de langage multimodaux (MLLMs). Il comprend 66 tâches couvrant cinq disciplines : astronomie, chimie, sciences de la Terre, sciences de la vie et science des matériaux. Chaque tâche combine des données visuelles scientifiques (graphiques, images expérimentales, etc.) avec des paires de questions-réponses formulées pour tester la perception, la compréhension et le raisonnement.

À quoi sert ce dataset ?

  • Évaluer la capacité des MLLMs à interpréter des données scientifiques complexes
  • Tester différentes couches de raisonnement scientifique dans des contextes réels
  • Fournir un benchmark standardisé pour la recherche en cognition artificielle

Peut-on l’enrichir ou l’améliorer ?

Oui, SFE peut être enrichi en ajoutant de nouvelles disciplines ou en traduisant les paires de questions en d’autres langues. Les chercheurs peuvent également créer des variantes des tâches avec différents niveaux de complexité ou fournir des notations humaines pour mieux calibrer les résultats d’évaluation.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Fournit des scripts de chargement et d’évaluation)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Aucun – données prêtes pour évaluation)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Très riche – tâches expertes et structurées)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants⚠️ Non – exige une compréhension scientifique avancée
🔁 Réutilisable en fine-tuning🎯 Possible pour le VQA scientifique ciblé
🌍 Diversité culturelle🌐 Bilingue anglais/chinois – bonne accessibilité globale

🧠 Recommandé pour

  • Laboratoires de recherche IA
  • Développeurs de MLLMs
  • Projets de cognition IA

🔧 Outils compatibles

  • Hugging Face
  • Lmms-eval
  • PyTorch
  • Gradio

💡 Astuce

Pour affiner vos modèles, commencez par les tâches de perception avant d’aborder le raisonnement comparatif.

Questions fréquemment posées

Ce benchmark peut-il être utilisé pour entraîner des modèles IA ?

Le dataset est conçu pour l’évaluation, mais peut être adapté au fine-tuning pour des tâches spécifiques de VQA scientifique.

En quelles langues les tâches sont-elles disponibles ?

Toutes les tâches sont disponibles en anglais et en chinois, ce qui favorise une évaluation multilingue des modèles.

Est-il nécessaire d’avoir une expertise scientifique pour exploiter ce dataset ?

Oui, certaines tâches demandent une bonne compréhension des disciplines scientifiques concernées pour une évaluation pertinente.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.