Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Finance QA Vision 100k
Multimodal

Finance QA Vision 100k

Este conjunto de datos contiene más de 100 000 pares de preguntas y respuestas en inglés, generados a partir de casi 10 000 imágenes de documentos financieros. Está diseñado para entrenar o probar los sistemas visuales de preguntas y respuestas (VQA) en el campo financiero.

Obtén el dataset
Tamaño

107 050 pares de control de calidad, 9 801 imágenes, formato estructurado (JSON/imagen)

Licencia

Apache-2.0

Descripción

‍

Sujet Finance QA Vision 100k es un conjunto de datos masivo que combina documentos financieros visuales y preguntas y respuestas textuales. Incluye 107 050 pares de control de calidad a partir de 9 801 imágenes, que representan varios tipos de documentos (informes, tablas, facturas, etc.).

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Desarrollar sistemas VQA (respuesta visual de preguntas) aplicados a documentos complejos
  • Mejorar la precisión del análisis de documentos financieros mediante OCR + comprensión semántica
  • Pruebe o perfeccione los LLM multimodales en un contexto profesional estructurado

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, este conjunto de datos se puede enriquecer con metadatos (tipos de documentos, nivel de complejidad, origen). También es posible añadir traducciones, anotaciones de OCR o respuestas múltiples en función de los casos ambiguos.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Volumen alto, requiere estructuración clara)
🧼 Necesidad de limpieza⭐⭐⭐⭐✩ (Bajo a moderado según caso de uso - formato QA estándar)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Muy buen nivel - Q, A, imagen, tipos variados)
📜 Licencia comercial✅ Sí (Apache-2.0)
👨‍💻 Ideal para principiantes⚡ Moderado – buena documentación pero volumen importante
🔁 Reutilizable para fine-tuning💰 Excelente para VQA u OCR especializado en finanzas
🌍 Diversidad cultural🇬🇧 Centrado en documentos financieros en inglés

‍

‍

🧠 Recomendado para

  • Investigadores del VQA
  • Desarrolladores de OCR inteligentes
  • Proyectos de LLM aplicados a la financiación

‍

‍

🔧 Herramientas compatibles

  • Donut
  • LayoutLMv3
  • Pix2Struct
  • Tesseract
  • Hugging Face Transformers

‍

‍

💡 Consejo

Filtre las preguntas por estructura o tipo de documento para obtener una formación especializada más eficaz.

Preguntas frecuentes

¿Las preguntas y respuestas se extraen de forma automática o manual?

Se generan automáticamente a partir del contenido de los documentos, con un alto nivel de coherencia entre lo visual y lo textual.

¿Este conjunto de datos es adecuado para modelos como LayoutLM o Pix2Struct?

Sí, es totalmente compatible con los modelos VQA documentales y con el procesamiento estructurado de textos en imágenes.

¿Se puede usar en un contexto multilingüe?

Actualmente, solo está en inglés, pero se puede enriquecer con la traducción o la alineación multilingüe.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.