Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Scientists' First Exam: evaluación cognitiva de los MLLM
Multimodal

Scientists' First Exam: evaluación cognitiva de los MLLM

Punto de referencia diseñado para evaluar la percepción, la comprensión y el razonamiento científico de los MLLM, a través de tareas que abarcan 5 disciplinas.

Obtén el dataset
Tamaño

66 tareas multimodales en control de calidad científico (imágenes y preguntas), formato JSON y archivos visuales

Licencia

MIT

Descripción

Scientists’ First Exam (SFE) es un punto de referencia de alta calidad para evaluar las capacidades cognitivas científicas de los modelos lingüísticos multimodales (MLLM). Incluye 66 tareas que abarcan cinco disciplinas: astronomía, química, ciencias de la tierra, ciencias de la vida y ciencia de los materiales. Cada tarea combina datos visuales científicos (gráficos, imágenes experimentales, etc.) con pares de preguntas y respuestas formuladas para evaluar la percepción, la comprensión y el razonamiento.

¿Para qué sirve este conjunto de datos?

  • Evalúe la capacidad de los MLM para interpretar datos científicos complejos
  • Pon a prueba diferentes capas de razonamiento científico en contextos reales
  • Proporcionar un punto de referencia estandarizado para la investigación de la cognición artificial

¿Se puede enriquecer o mejorar?

Sí, el SFE se puede enriquecer añadiendo nuevas disciplinas o traduciendo los pares de preguntas a otros idiomas. Los investigadores también pueden crear variantes de tareas con distintos niveles de complejidad o proporcionar calificaciones humanas para calibrar mejor los resultados de las evaluaciones.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Proporciona scripts de carga y evaluación)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ninguno – datos listos para evaluación)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Muy rico – tareas expertas y estructuradas)
📜 Licencia comercial✅ Sí (MIT)
👨‍💻 Ideal para principiantes⚠️ No – requiere comprensión científica avanzada
🔁 Reutilizable para fine-tuning🎯 Posible para VQA científico especializado
🌍 Diversidad cultural🌐 Bilingüe inglés/chino – buena accesibilidad global

🧠 Recomendado para

  • Laboratorios de investigación de IA
  • programadores de MLMS
  • Proyectos de cognición con IA

🔧 Herramientas compatibles

  • Hugging Face
  • Lmms-eval
  • PyTorch
  • Gradio

💡 Consejo

Para refinar sus modelos, comience con las tareas de percepción antes de pasar al razonamiento comparativo.

Preguntas frecuentes

¿Se puede utilizar este punto de referencia para entrenar modelos de IA?

El conjunto de datos está diseñado para la evaluación, pero se puede adaptar para ajustarlo a tareas científicas específicas de VQA.

¿En qué idiomas están disponibles las tareas?

Todas las tareas están disponibles en inglés y chino, lo que fomenta la evaluación multilingüe de los modelos.

¿Es necesario tener experiencia científica para explotar este conjunto de datos?

Sí, algunas tareas requieren una buena comprensión de las disciplinas científicas en cuestión para una evaluación relevante.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.