Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Common Voice: corpus de audio para el reconocimiento de voz
Audio

Common Voice: corpus de audio para el reconocimiento de voz

Common Voice es un corpus de audio comunitario que comprende miles de grabaciones de voz con sus transcripciones de texto. El conjunto de datos se utiliza principalmente para entrenar y evaluar los sistemas de reconocimiento automático de voz (ASR).

Obtén el dataset
Tamaño

Varios miles de archivos de audio MP3 acompañados de archivos CSV de metadatos, multilingües

Licencia

CC0: Dominio público

Descripción

El conjunto de datos Common Voice contiene miles de archivos de audio MP3 acompañados de transcripciones validadas por varios oyentes. Está dividido en conjuntos de entrenamiento, desarrollo y pruebas, con metadatos detallados sobre la edad, el género, el enfoque y la calidad de cada grabación.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos de ASR robustos con diversos datos de voz
  • Evalúe el reconocimiento de voz según criterios demográficos y lingüísticos
  • Realice ajustes precisos en voces específicas o en varios idiomas

¿Se puede enriquecer o mejorar?

Sí, este corpus está abierto a la contribución de la comunidad a través de la plataforma Common Voice. Las anotaciones se pueden refinar mediante validaciones adicionales y se pueden ampliar los idiomas. También se pueden agregar metadatos adicionales para mejorar los casos de uso.

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐⭐☆ (metadatos completos, requiere manejo de archivos de audio)
🧼Necesidad de limpieza ⭐⭐⭐⭐☆ (baja a moderada según el uso, clips inválidos separados)
🏷️Riqueza de anotaciones ⭐⭐⭐⭐☆ (transcripciones validadas, metadatos demográficos)
📜Licencia comercial ✅ Sí (CC0)
👨‍💻Ideal para principiantes 👨‍🎓 Sí, para proyectos ASR con guía adecuada
🔁Reutilizable para fine-tuning 🔥 Perfecto para adaptación de voz y acentos
🌍Diversidad cultural 🌍 Gran diversidad de edades, géneros y acentos

🧠 Recomendado para

  • Investigadores de reconocimiento de voz
  • programadores ASR
  • Proyectos multilingües

🔧 Herramientas compatibles

  • Kaldi
  • ESPnet
  • Hugging Face Transformers
  • PyTorch
  • TensorFlow

💡 Consejo

Seleccione subconjuntos validados para una formación óptima y fiable.

Preguntas frecuentes

¿Qué idiomas cubre Common Voice?

Common Voice cubre numerosos idiomas y acentos, con una fuerte presencia del inglés, pero también otros idiomas según las contribuciones.

¿Están validados todos los archivos de audio?

Solo los archivos de los conjuntos «válidos» fueron validados por varios auditores, garantizando la correspondencia audio-texto.

¿Podemos contribuir a este conjunto de datos?

Sí, Common Voice es un proyecto comunitario abierto en el que cualquiera puede grabar y validar clips de audio para enriquecer el corpus.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.