BullshitEval – Évaluation de la fiabilité des assistants IA
Benchmark de 2 400 scénarios répartis sur 100 modèles d’assistants IA, utilisé pour détecter et mesurer la "bullshit machine".
Description
BullshitEval est un benchmark composé de 2 400 scénarios couvrant 100 assistants IA. Il permet d'évaluer la qualité des réponses fournies par ces modèles à travers différents types de requêtes : questions générales, tests de flatterie, préoccupations négatives, etc. Le dataset inclut le contexte, le prompt système, la question et le type de test.
À quoi sert ce dataset ?
- Mesurer la capacité des LLMs à éviter les réponses incohérentes ou erronées
- Évaluer le comportement des IA face à différentes catégories de prompts
- Construire des benchmarks robustes pour la recherche en fiabilité des IA
Peut-on l’enrichir ou l’améliorer ?
Oui, BullshitEval peut être adapté à d'autres langues ou élargi avec de nouveaux types de tests (ex. hallucinations, biais culturels). Il est également possible d’y ajouter des annotations humaines sur la qualité des réponses ou d’inclure d'autres modèles IA dans l’évaluation.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en IA
- Ingénieurs LLM
- Créateurs de benchmarks
🔧 Outils compatibles
- Hugging Face Datasets
- Pandas
- Jupyter
- Frameworks d’évaluation LLM
💡 Astuce
Utilisez-le avec plusieurs LLMs en parallèle pour comparer les performances en conditions identiques.
Questions fréquemment posées
Peut-on utiliser BullshitEval pour évaluer des modèles open-source comme Mistral ou LLaMA ?
Oui, le format est universel. Vous pouvez tester n’importe quel modèle en utilisant les mêmes prompts que ceux fournis dans le benchmark.
Est-ce que le dataset inclut des notations humaines de qualité ?
Non, les réponses des modèles ne sont pas notées. Il sert plutôt de base standardisée pour conduire vos propres évaluations.
Le dataset est-il adapté pour tester des assistants IA en langue française ?
Le contenu est en anglais, mais les scénarios peuvent être traduits et adaptés pour des assistants IA francophones.



