Finance QA Vision 100k
Este conjunto de datos contiene más de 100 000 pares de preguntas y respuestas en inglés, generados a partir de casi 10 000 imágenes de documentos financieros. Está diseñado para entrenar o probar los sistemas visuales de preguntas y respuestas (VQA) en el campo financiero.
107 050 pares de control de calidad, 9 801 imágenes, formato estructurado (JSON/imagen)
Apache-2.0
Descripción
Sujet Finance QA Vision 100k es un conjunto de datos masivo que combina documentos financieros visuales y preguntas y respuestas textuales. Incluye 107 050 pares de control de calidad a partir de 9 801 imágenes, que representan varios tipos de documentos (informes, tablas, facturas, etc.).
¿Para qué sirve este conjunto de datos?
- Desarrollar sistemas VQA (respuesta visual de preguntas) aplicados a documentos complejos
- Mejorar la precisión del análisis de documentos financieros mediante OCR + comprensión semántica
- Pruebe o perfeccione los LLM multimodales en un contexto profesional estructurado
¿Se puede enriquecer o mejorar?
Sí, este conjunto de datos se puede enriquecer con metadatos (tipos de documentos, nivel de complejidad, origen). También es posible añadir traducciones, anotaciones de OCR o respuestas múltiples en función de los casos ambiguos.
🔎 En resumen
🧠 Recomendado para
- Investigadores del VQA
- Desarrolladores de OCR inteligentes
- Proyectos de LLM aplicados a la financiación
🔧 Herramientas compatibles
- Donut
- LayoutLMv3
- Pix2Struct
- Tesseract
- Hugging Face Transformers
💡 Consejo
Filtre las preguntas por estructura o tipo de documento para obtener una formación especializada más eficaz.
Preguntas frecuentes
¿Las preguntas y respuestas se extraen de forma automática o manual?
Se generan automáticamente a partir del contenido de los documentos, con un alto nivel de coherencia entre lo visual y lo textual.
¿Este conjunto de datos es adecuado para modelos como LayoutLM o Pix2Struct?
Sí, es totalmente compatible con los modelos VQA documentales y con el procesamiento estructurado de textos en imágenes.
¿Se puede usar en un contexto multilingüe?
Actualmente, solo está en inglés, pero se puede enriquecer con la traducción o la alineación multilingüe.




