Sujet Finance QA Vision 100k
Ce dataset contient plus de 100 000 paires question-réponse en anglais, générées à partir de près de 10 000 images de documents financiers. Il est conçu pour entraîner ou tester des systèmes de question-réponse visuelle (VQA) dans le domaine financier.
107 050 paires QA, 9 801 images, format structuré (JSON/Image)
Apache-2.0
Description
Sujet Finance QA Vision 100k est un jeu de données massif combinant documents financiers visuels et questions-réponses textuelles. Il comprend 107 050 paires QA issues de 9 801 images, représentant divers types de documents (rapports, tableaux, factures, etc.).
À quoi sert ce dataset ?
- Développer des systèmes de VQA (Visual Question Answering) appliqués à des documents complexes
- Améliorer la précision de l’analyse de documents financiers via OCR + compréhension sémantique
- Tester ou affiner des LLMs multimodaux dans un contexte professionnel structuré
Peut-on l’enrichir ou l’améliorer ?
Oui, ce dataset peut être enrichi avec des métadonnées (types de documents, niveau de complexité, provenance). Il est aussi possible d’y ajouter des traductions, des annotations OCR ou des réponses multiples selon les cas ambigus.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en VQA
- Développeurs OCR intelligents
- Projets LLMs appliqués à la finance
🔧 Outils compatibles
- Donut
- LayoutLMv3
- Pix2Struct
- Tesseract
- Hugging Face Transformers
💡 Astuce
Filtrer les questions par structure ou type de document pour des entraînements spécialisés plus efficaces.
Questions fréquemment posées
Les questions-réponses sont-elles extraites automatiquement ou manuellement ?
Elles sont générées automatiquement à partir du contenu des documents, avec un haut niveau de cohérence entre visuel et texte.
Ce dataset est-il adapté aux modèles comme LayoutLM ou Pix2Struct ?
Oui, il est parfaitement compatible avec les modèles de VQA documentaires et de traitement structuré du texte dans les images.
Peut-on l’utiliser dans un contexte multilingue ?
Actuellement, il est uniquement en anglais, mais peut être enrichi par traduction ou alignement multilingue.




