T2-RAGBench
Benchmark QA financier combinant documents texte et tableaux pour tester les systèmes RAG, avec plus de 30 000 questions et documents PDF originaux.
32 908 paires QA, 9000+ documents avec contextes texte et tableau, PDF et JSON
CC-BY 4.0
Description
T2-RAGBench est un benchmark conçu pour évaluer les modèles de génération augmentée par récupération (RAG) appliqués à des documents financiers. Il combine des documents complexes — avec texte et tableaux — issus de sources comme FinQA ou ConvFinQA. Chaque échantillon comprend une question indépendante du contexte, une réponse vérifiée et un contexte complet dérivé de documents PDF. Les documents d’origine sont également fournis pour des tâches plus poussées.
À quoi sert ce dataset ?
- Évaluer la capacité d’un modèle à extraire l’information pertinente à partir de documents complexes (texte + tableaux)
- Tester les performances de systèmes RAG dans un contexte financier réel
- Construire ou affiner des systèmes QA documentaires spécialisés
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible d’ajouter d’autres types de documents financiers, ou de créer des variantes multilingues. De plus, les documents PDF originaux permettent d’améliorer les annotations contextuelles ou de réentraîner des extracteurs spécialisés.
🔎 En résumé
🧠 Recommandé pour
- Ingénieurs NLP
- Chercheurs en QA documentaire
- Projets RAG
🔧 Outils compatibles
- Haystack
- LangChain
- Hugging Face Transformers
- PyMuPDF
💡 Astuce
Utilisez les fichiers PDF originaux pour entraîner des extracteurs contextuels plus robustes ou tester des workflows de parsing.
Questions fréquemment posées
Est-ce que ce dataset peut être utilisé pour entraîner un modèle RAG complet ?
Oui, il est spécifiquement conçu pour cela avec des paires QA enrichies et un contexte mixte texte-table extrait de documents.
Ce dataset contient-il uniquement du texte ou aussi d’autres types de données ?
Il contient à la fois du texte et des tableaux extraits de fichiers PDF, ce qui en fait un jeu de données véritablement multimodal.
Peut-on télécharger les fichiers PDF d’origine ?
Oui, les PDF sont inclus et organisés par dossier. Il suffit de cloner le dépôt lié pour y accéder.




