AudioTrust : Benchmark ALLMs
AudioTrust est un benchmark à grande échelle conçu pour évaluer les modèles de langage audio (ALLMs) sur six axes critiques : hallucination, sécurité, robustesse, équité, vie privée et résistance aux attaques. Il fournit des tâches et métriques standardisées pour tester la fiabilité réelle des systèmes IA audio.
Format audio + annotations structurées, benchmark multi-tâches (6 dimensions), fichiers WAV + JSON
CC-BY-SA 4.0
Description
AudioTrust est un benchmark d’évaluation conçu pour tester en profondeur les modèles audio multimodaux (ALLMs). Il couvre six dimensions essentielles : détection d’hallucinations, robustesse aux corruptions, tests de spoofing vocal, fuites de données privées, équité démographique et génération de contenu dangereux.
À quoi sert ce dataset ?
- Évaluer la résistance d’un modèle audio aux attaques de clonage vocal
- Tester la génération audio et textuelle sous contrainte de sécurité
- Auditer les biais démographiques dans les réponses vocales générées
Peut-on l’enrichir ou l’améliorer ?
Oui, AudioTrust peut être complété par des voix supplémentaires issues de différentes langues ou groupes démographiques. Il est aussi possible d’y ajouter de nouveaux scénarios d’attaque, des tâches en langues non anglaises, ou de combiner les tests avec des évaluations humaines pour des résultats plus robustes.
👉 Pour en savoir plus sur nos services d'annotation audio, n'hésitez pas à nous contacter !
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en sécurité IA
- Développeurs d’outils d’authentification vocale
- Auditeurs de modèles audio
🔧 Outils compatibles
- PyTorch
- Whisper
- Transformers
- DeepSpeech
- Librosa
💡 Astuce
Pour tester finement la robustesse, injectez des perturbations audio simulées avec des bruits ou distorsions réalistes avant évaluation.
Questions fréquemment posées
Ce dataset est-il destiné à l’entraînement de modèles audio ?
Non, il est conçu pour l’évaluation de modèles existants sur des critères de confiance, pas pour le fine-tuning.
Quels types de modèles peut-on tester avec AudioTrust ?
Il est conçu pour les modèles audio multimodaux (ALLMs), mais peut aussi servir à tester des modèles ASR, vocodeurs ou encodeurs vocaux.
Le dataset contient-il des données vocales réelles ou synthétiques ?
Il combine des enregistrements réels et scénarisés pour simuler des attaques et des conditions variées de test.




