StreamUni
Dataset audio utilisé pour entraîner un modèle de traduction vocale en continu. Idéal pour les tâches de streaming speech translation.
Description
StreamUni est un dataset audio structuré pour les tâches de traduction vocale en flux continu. Il contient 9 631 échantillons audio avec les transcriptions et traductions associées, utilisé pour entraîner le modèle StreamUni-Phi4. Le dataset est compact (~693 Mo) et fournit une base solide pour les recherches en streaming speech translation.
À quoi sert ce dataset ?
- Former des modèles capables de traduire la parole en direct (streaming speech translation)
- Tester l’efficacité de systèmes multilingues de transcription/traduction en temps réel
- Servir de base pour des assistants vocaux ou applications de sous-titrage automatique
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible d’augmenter ce dataset avec des langues supplémentaires, des métadonnées audio (durée, accent, locuteur) ou encore des annotations sur la fluidité/traductibilité. Une segmentation plus fine pourrait aussi améliorer les performances en mode streaming.
🔎 En résumé
🧠 Recommandé pour
- Ingénieurs speech NLP
- Projets de traduction vocale
- Prototypage de sous-titrage automatique
🔧 Outils compatibles
- Hugging Face Datasets
- Whisper
- ESPnet
- Fairseq
💡 Astuce
Pour une traduction plus fluide, coupez les fichiers longs en unités de parole plus courtes.
Questions fréquemment posées
Ce dataset est-il adapté à la traduction hors ligne ?
Il a été conçu pour le streaming, mais peut aussi servir dans des scénarios de traduction audio hors ligne.
Peut-on facilement l’intégrer dans un pipeline Hugging Face ?
Oui, il est disponible en format Parquet et compatible avec la librairie `datasets` de Hugging Face.
Est-il multilingue ?
Il inclut des données multilingues, mais l’ensemble des langues couvertes dépend du modèle utilisé pour la génération initiale.




