En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
StreamUni
Audio

StreamUni

Dataset audio utilisé pour entraîner un modèle de traduction vocale en continu. Idéal pour les tâches de streaming speech translation.

Télécharger le dataset
Taille

9 631 fichiers audio, format Parquet (~693 Mo)

Licence

Apache 2.0

Description

‍

StreamUni est un dataset audio structuré pour les tâches de traduction vocale en flux continu. Il contient 9 631 échantillons audio avec les transcriptions et traductions associées, utilisé pour entraîner le modèle StreamUni-Phi4. Le dataset est compact (~693 Mo) et fournit une base solide pour les recherches en streaming speech translation.

‍

‍

À quoi sert ce dataset ?

‍

  • Former des modèles capables de traduire la parole en direct (streaming speech translation)
  • Tester l’efficacité de systèmes multilingues de transcription/traduction en temps réel
  • Servir de base pour des assistants vocaux ou applications de sous-titrage automatique

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui. Il est possible d’augmenter ce dataset avec des langues supplémentaires, des métadonnées audio (durée, accent, locuteur) ou encore des annotations sur la fluidité/traductibilité. Une segmentation plus fine pourrait aussi améliorer les performances en mode streaming.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Facile à utiliser avec Hugging Face)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – données bien préparées)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Transcriptions et traductions disponibles)
📜 Licence commerciale✅ Oui (Apache 2.0)
👨‍💻 Idéal pour les débutants⚠️ Nécessite quelques notions audio/linguistique
🔁 Réutilisable en fine-tuning🎯 Très adapté au fine-tuning de modèles speech-to-text
🌍 Diversité culturelle⚠️ Moyenne – à enrichir pour plus de langues ou accents

‍

‍

🧠 Recommandé pour

  • Ingénieurs speech NLP
  • Projets de traduction vocale
  • Prototypage de sous-titrage automatique

‍

‍

🔧 Outils compatibles

  • Hugging Face Datasets
  • Whisper
  • ESPnet
  • Fairseq

‍

‍

💡 Astuce

Pour une traduction plus fluide, coupez les fichiers longs en unités de parole plus courtes.

Questions fréquemment posées

Ce dataset est-il adapté à la traduction hors ligne ?

Il a été conçu pour le streaming, mais peut aussi servir dans des scénarios de traduction audio hors ligne.

Peut-on facilement l’intégrer dans un pipeline Hugging Face ?

Oui, il est disponible en format Parquet et compatible avec la librairie `datasets` de Hugging Face.

Est-il multilingue ?

Il inclut des données multilingues, mais l’ensemble des langues couvertes dépend du modèle utilisé pour la génération initiale.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.