Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
T2-RAGBench
Multimodal

T2-RAGBench

El control de calidad financiero de referencia combina documentos de texto y tablas para probar los sistemas RAG, con más de 30 000 preguntas y documentos PDF originales.

Obtén el dataset
Tamaño

32 908 pares de control de calidad, más de 9000 documentos con contextos de texto y tablas, PDF y JSON

Licencia

CC-BY 4.0

Descripción

T2-RAGBench es un punto de referencia diseñado para evaluar los modelos de generación aumentada por recuperación (RAG) aplicados a los documentos financieros. Combina documentos complejos (con texto y tablas) de fuentes como FinQa o ConvFinQa. Cada muestra incluye una pregunta independiente del contexto, una respuesta verificada y un contexto completo derivado de documentos PDF. También se proporciona documentación original para tareas más avanzadas.

¿Para qué sirve este conjunto de datos?

  • Evalúe la capacidad de un modelo para extraer información relevante de documentos complejos (texto y tablas)
  • Probar el rendimiento de los sistemas RAG en un contexto financiero real
  • Creación o perfeccionamiento de sistemas de control de calidad documental especializados

¿Se puede enriquecer o mejorar?

Sí Es posible añadir otros tipos de documentos financieros o crear variantes multilingües. Además, los documentos PDF originales se pueden utilizar para mejorar las anotaciones contextuales o para volver a capacitar a los extractores especializados.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Requiere cierta manipulación de formatos PDF y tablas)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo: datos ya bien estructurados)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Rico: contexto, respuestas verificadas, procedencia PDF clara)
📜 Licencia comercial✅ Sí (CC-BY 4.0)
👨‍💻 Ideal para principiantes⚠️ Medio: requiere buenas bases en NLP documental
🔁 Reutilizable para fine-tuning🎯 Excelente para ajustar modelos QA especializados
🌍 Diversidad cultural⚠️ Limitado al inglés y al ámbito financiero

🧠 Recomendado para

  • Ingenieros de PNL
  • Investigadores de control de calidad documental
  • Proyectos RAG

🔧 Herramientas compatibles

  • Haystack
  • LangChain
  • Hugging Face Transformers
  • PyMuPDF

💡 Consejo

Utilice archivos PDF originales para entrenar extractores contextuales más sólidos o probar los flujos de trabajo de análisis.

Preguntas frecuentes

¿Se puede usar este conjunto de datos para entrenar un modelo RAG completo?

Sí, está diseñado específicamente para eso con pares de control de calidad enriquecidos y un contexto mixto de tablas de texto extraído de documentos.

¿Este conjunto de datos solo contiene texto u otros tipos de datos?

Contiene texto y tablas extraídas de archivos PDF, lo que lo convierte en un conjunto de datos verdaderamente multimodal.

¿Podemos descargar los PDF originales?

Sí, los archivos PDF están incluidos y organizados por carpetas. Solo necesitas clonar el repositorio enlazado para acceder a él.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.