Scientists' First Exam: evaluación cognitiva de los MLLM
Punto de referencia diseñado para evaluar la percepción, la comprensión y el razonamiento científico de los MLLM, a través de tareas que abarcan 5 disciplinas.
66 tareas multimodales en control de calidad científico (imágenes y preguntas), formato JSON y archivos visuales
MIT
Descripción
Scientists’ First Exam (SFE) es un punto de referencia de alta calidad para evaluar las capacidades cognitivas científicas de los modelos lingüísticos multimodales (MLLM). Incluye 66 tareas que abarcan cinco disciplinas: astronomía, química, ciencias de la tierra, ciencias de la vida y ciencia de los materiales. Cada tarea combina datos visuales científicos (gráficos, imágenes experimentales, etc.) con pares de preguntas y respuestas formuladas para evaluar la percepción, la comprensión y el razonamiento.
¿Para qué sirve este conjunto de datos?
- Evalúe la capacidad de los MLM para interpretar datos científicos complejos
- Pon a prueba diferentes capas de razonamiento científico en contextos reales
- Proporcionar un punto de referencia estandarizado para la investigación de la cognición artificial
¿Se puede enriquecer o mejorar?
Sí, el SFE se puede enriquecer añadiendo nuevas disciplinas o traduciendo los pares de preguntas a otros idiomas. Los investigadores también pueden crear variantes de tareas con distintos niveles de complejidad o proporcionar calificaciones humanas para calibrar mejor los resultados de las evaluaciones.
🔎 En resumen
🧠 Recomendado para
- Laboratorios de investigación de IA
- programadores de MLMS
- Proyectos de cognición con IA
🔧 Herramientas compatibles
- Hugging Face
- Lmms-eval
- PyTorch
- Gradio
💡 Consejo
Para refinar sus modelos, comience con las tareas de percepción antes de pasar al razonamiento comparativo.
Preguntas frecuentes
¿Se puede utilizar este punto de referencia para entrenar modelos de IA?
El conjunto de datos está diseñado para la evaluación, pero se puede adaptar para ajustarlo a tareas científicas específicas de VQA.
¿En qué idiomas están disponibles las tareas?
Todas las tareas están disponibles en inglés y chino, lo que fomenta la evaluación multilingüe de los modelos.
¿Es necesario tener experiencia científica para explotar este conjunto de datos?
Sí, algunas tareas requieren una buena comprensión de las disciplinas científicas en cuestión para una evaluación relevante.




