Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
StreamUni
Audio

StreamUni

Conjunto de datos de audio utilizado para entrenar un modelo de traducción continua de voz. Ideal para tareas de transmisión de traducción de voz.

Obtén el dataset
Tamaño

9.631 archivos de audio, formato Parquet (~693 MB)

Licencia

Apache 2.0

Descripción

‍

StreamUni es un conjunto de datos de audio estructurado para tareas continuas de traducción de voz. Contiene 9.631 muestras de audio con las transcripciones y traducciones asociadas, que se utilizan para entrenar el modelo StreamUni-PHI4. El conjunto de datos es compacto (aproximadamente 693 MB) y proporciona una base sólida para las búsquedas de traducción de voz en streaming.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Capacite modelos capaces de traducir voz en vivo (traducción de voz en streaming)
  • Probar la eficacia de los sistemas de transcripción/traducción multilingües en tiempo real
  • Sirve de base para asistentes de voz o aplicaciones de subtitulado automático

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí. Es posible aumentar este conjunto de datos con idiomas adicionales, metadatos de audio (duración, acento, hablante) o incluso anotaciones sobre la fluidez o la traducibilidad. Una segmentación más precisa también podría mejorar el rendimiento en el modo streaming.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Fácil de usar con Hugging Face)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos bien preparados)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Transcripciones y traducciones disponibles)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes⚠️ Requiere algunos conocimientos de audio/lingüística
🔁 Reutilizable para fine-tuning🎯 Muy adecuado para fine-tuning de modelos speech-to-text
🌍 Diversidad cultural⚠️ Moderado – a enriquecer para más idiomas o acentos

‍

‍

🧠 Recomendado para

  • Ingenieros de voz en PNL
  • Proyectos de traducción de voz
  • Creación automática de prototipos de subtitulación

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • Whisper
  • ESPnet
  • Fairseq

‍

‍

💡 Consejo

Para una traducción más fluida, corte los archivos largos en unidades de voz más cortas.

Preguntas frecuentes

¿Este conjunto de datos es adecuado para la traducción sin conexión?

Fue diseñado para la transmisión, pero también se puede usar en escenarios de traducción de audio sin conexión.

¿Se puede integrar fácilmente en una canalización de Hugging Face?

Sí, está disponible en formato Parquet y es compatible con la biblioteca de «conjuntos de datos» de Hugging Face.

¿Es multilingüe?

Incluye datos multilingües, pero el conjunto de idiomas incluidos depende del modelo utilizado para la generación inicial.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.