En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
PhyX Multimodal Physics Reasoning
Multimodal

PhyX Multimodal Physics Reasoning

Un jeu de données unique pour tester le raisonnement physique de niveau universitaire à travers des questions complexes illustrées par des images fidèles.

Télécharger le dataset
Taille

3 000 questions visuelles, formats TSV + images PNG

Licence

MIT

Description

PhyX est un benchmark de nouvelle génération conçu pour évaluer les compétences des modèles d'IA en raisonnement physique multimodal. Il regroupe 3 000 questions couvrant six grands domaines de la physique (mécanique, optique, thermodynamique, etc.), chaque question étant accompagnée d’une image réaliste et d’un contexte textuel simplifié. Le tout forme un corpus rigoureux pour tester la capacité d’inférence scientifique au-delà de la simple mémorisation de faits.

À quoi sert ce dataset ?

  • Évaluer ou entraîner des modèles multimodaux sur du raisonnement physique avancé
  • Mesurer la capacité des LLM à intégrer informations visuelles et lois implicites
  • Construire des benchmarks d’IA scientifique exigeants (niveau universitaire)

Peut-on l’enrichir ou l’améliorer ?

Oui. On peut ajouter d’autres modalités comme des vidéos, enrichir les options de réponses ou créer des versions traduites multilingues. Des annotations supplémentaires sur les types de raisonnements ou la complexité cognitive seraient également bénéfiques pour des tâches de fine-tuning.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Bonne – structure claire en TSV et JSON)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – corpus bien structuré, peu de bruit)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Excellente – contexte, image, catégories, type de raisonnement)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants⚠️ Non – nécessite de bonnes bases en physique
🔁 Réutilisable en fine-tuning🎯 Parfait pour entraînement spécialisé en QA physique
🌍 Diversité culturelle⚖️ Neutre – contenu académique universel

🧠 Recommandé pour

  • Chercheurs en IA scientifique
  • Concepteurs de benchmarks
  • Développeurs de LLM spécialisés

🔧 Outils compatibles

  • Hugging Face Transformers
  • OpenFlamingo
  • VLMEvalKit
  • PyTorch

💡 Astuce

Utilisez le sous-ensemble “mini” pour du prototypage rapide avant d'exploiter l’ensemble complet pour les benchmarks ou le fine-tuning.

Questions fréquemment posées

Ce dataset inclut-il des vidéos ou uniquement des images statiques ?

Il se base sur des images réalistes statiques, pas de vidéos. Chaque question est liée à une image illustrative au format PNG.

Ce jeu de données est-il adapté à l'entraînement ou seulement à l'évaluation ?

Il est principalement conçu pour l’évaluation, mais peut aussi être utilisé pour le fine-tuning avec des modèles adaptés.

Quels types de raisonnement sont couverts dans les questions ?

Les questions couvrent 6 types de raisonnement physique (ex. causalité, dynamique, relations spatio-temporelles…) sur 25 sous-domaines.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.