StreamUni
Conjunto de datos de audio utilizado para entrenar un modelo de traducción continua de voz. Ideal para tareas de transmisión de traducción de voz.
Descripción
StreamUni es un conjunto de datos de audio estructurado para tareas continuas de traducción de voz. Contiene 9.631 muestras de audio con las transcripciones y traducciones asociadas, que se utilizan para entrenar el modelo StreamUni-PHI4. El conjunto de datos es compacto (aproximadamente 693 MB) y proporciona una base sólida para las búsquedas de traducción de voz en streaming.
¿Para qué sirve este conjunto de datos?
- Capacite modelos capaces de traducir voz en vivo (traducción de voz en streaming)
- Probar la eficacia de los sistemas de transcripción/traducción multilingües en tiempo real
- Sirve de base para asistentes de voz o aplicaciones de subtitulado automático
¿Se puede enriquecer o mejorar?
Sí. Es posible aumentar este conjunto de datos con idiomas adicionales, metadatos de audio (duración, acento, hablante) o incluso anotaciones sobre la fluidez o la traducibilidad. Una segmentación más precisa también podría mejorar el rendimiento en el modo streaming.
🔎 En resumen
🧠 Recomendado para
- Ingenieros de voz en PNL
- Proyectos de traducción de voz
- Creación automática de prototipos de subtitulación
🔧 Herramientas compatibles
- Hugging Face Datasets
- Whisper
- ESPnet
- Fairseq
💡 Consejo
Para una traducción más fluida, corte los archivos largos en unidades de voz más cortas.
Preguntas frecuentes
¿Este conjunto de datos es adecuado para la traducción sin conexión?
Fue diseñado para la transmisión, pero también se puede usar en escenarios de traducción de audio sin conexión.
¿Se puede integrar fácilmente en una canalización de Hugging Face?
Sí, está disponible en formato Parquet y es compatible con la biblioteca de «conjuntos de datos» de Hugging Face.
¿Es multilingüe?
Incluye datos multilingües, pero el conjunto de idiomas incluidos depende del modelo utilizado para la generación inicial.




