En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Sujet Finance QA Vision 100k
Multimodal

Sujet Finance QA Vision 100k

Ce dataset contient plus de 100 000 paires question-réponse en anglais, générées à partir de près de 10 000 images de documents financiers. Il est conçu pour entraîner ou tester des systèmes de question-réponse visuelle (VQA) dans le domaine financier.

Télécharger le dataset
Taille

107 050 paires QA, 9 801 images, format structuré (JSON/Image)

Licence

Apache-2.0

Description

‍

Sujet Finance QA Vision 100k est un jeu de données massif combinant documents financiers visuels et questions-réponses textuelles. Il comprend 107 050 paires QA issues de 9 801 images, représentant divers types de documents (rapports, tableaux, factures, etc.).

‍

‍

À quoi sert ce dataset ?

‍

  • Développer des systèmes de VQA (Visual Question Answering) appliqués à des documents complexes
  • Améliorer la précision de l’analyse de documents financiers via OCR + compréhension sémantique
  • Tester ou affiner des LLMs multimodaux dans un contexte professionnel structuré

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, ce dataset peut être enrichi avec des métadonnées (types de documents, niveau de complexité, provenance). Il est aussi possible d’y ajouter des traductions, des annotations OCR ou des réponses multiples selon les cas ambigus.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Volume élevé, nécessite structuration claire)
🧼 Besoin de nettoyage⭐⭐⭐⭐✩ (Faible à modéré selon cas d'usage - format QA standard)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Très bon niveau - Q, A, image, types variés)
📜 Licence commerciale✅ Oui (Apache-2.0)
👨‍💻 Idéal pour les débutants⚡ Moyennement – bonne documentation mais volume important
🔁 Réutilisable en fine-tuning💰 Excellent pour VQA ou OCR spécialisé finance
🌍 Diversité culturelle🇬🇧 Centré sur documents financiers anglophones

‍

‍

🧠 Recommandé pour

  • Chercheurs en VQA
  • Développeurs OCR intelligents
  • Projets LLMs appliqués à la finance

‍

‍

🔧 Outils compatibles

  • Donut
  • LayoutLMv3
  • Pix2Struct
  • Tesseract
  • Hugging Face Transformers

‍

‍

💡 Astuce

Filtrer les questions par structure ou type de document pour des entraînements spécialisés plus efficaces.

Questions fréquemment posées

Les questions-réponses sont-elles extraites automatiquement ou manuellement ?

Elles sont générées automatiquement à partir du contenu des documents, avec un haut niveau de cohérence entre visuel et texte.

Ce dataset est-il adapté aux modèles comme LayoutLM ou Pix2Struct ?

Oui, il est parfaitement compatible avec les modèles de VQA documentaires et de traitement structuré du texte dans les images.

Peut-on l’utiliser dans un contexte multilingue ?

Actuellement, il est uniquement en anglais, mais peut être enrichi par traduction ou alignement multilingue.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.