En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
BullshitEval – Évaluation de la fiabilité des assistants IA
Texte

BullshitEval – Évaluation de la fiabilité des assistants IA

Benchmark de 2 400 scénarios répartis sur 100 modèles d’assistants IA, utilisé pour détecter et mesurer la "bullshit machine".

Télécharger le dataset
Taille

2 400 exemples texte au format JSON

Licence

MIT

Description

BullshitEval est un benchmark composé de 2 400 scénarios couvrant 100 assistants IA. Il permet d'évaluer la qualité des réponses fournies par ces modèles à travers différents types de requêtes : questions générales, tests de flatterie, préoccupations négatives, etc. Le dataset inclut le contexte, le prompt système, la question et le type de test.

À quoi sert ce dataset ?

  • Mesurer la capacité des LLMs à éviter les réponses incohérentes ou erronées
  • Évaluer le comportement des IA face à différentes catégories de prompts
  • Construire des benchmarks robustes pour la recherche en fiabilité des IA

Peut-on l’enrichir ou l’améliorer ?

Oui, BullshitEval peut être adapté à d'autres langues ou élargi avec de nouveaux types de tests (ex. hallucinations, biais culturels). Il est également possible d’y ajouter des annotations humaines sur la qualité des réponses ou d’inclure d'autres modèles IA dans l’évaluation.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Très facile via Hugging Face Datasets)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Aucun nettoyage requis – données prêtes à l’emploi)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Annoté par type de question et type de prompt système)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants🌟 Oui, simple à explorer et à utiliser
🔁 Réutilisable en fine-tuning⚠️ Pas conçu pour le fine-tuning, mais utile pour l’évaluation
🌍 Diversité culturelle⚠️ À enrichir – actuellement centré sur l’anglais

🧠 Recommandé pour

  • Chercheurs en IA
  • Ingénieurs LLM
  • Créateurs de benchmarks

🔧 Outils compatibles

  • Hugging Face Datasets
  • Pandas
  • Jupyter
  • Frameworks d’évaluation LLM

💡 Astuce

Utilisez-le avec plusieurs LLMs en parallèle pour comparer les performances en conditions identiques.

Questions fréquemment posées

Peut-on utiliser BullshitEval pour évaluer des modèles open-source comme Mistral ou LLaMA ?

Oui, le format est universel. Vous pouvez tester n’importe quel modèle en utilisant les mêmes prompts que ceux fournis dans le benchmark.

Est-ce que le dataset inclut des notations humaines de qualité ?

Non, les réponses des modèles ne sont pas notées. Il sert plutôt de base standardisée pour conduire vos propres évaluations.

Le dataset est-il adapté pour tester des assistants IA en langue française ?

Le contenu est en anglais, mais les scénarios peuvent être traduits et adaptés pour des assistants IA francophones.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.