Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
VietVault : Corpus Vietnamien de Grande Échelle
Texto

VietVault : Corpus Vietnamien de Grande Échelle

VietVault es un enorme corpus en vietnamita creado a partir de Common Crawl (2013-2023). Tras detectar el idioma, limpiar, deduplicar y filtrar el contenido tóxico, proporciona una base sólida para el entrenamiento previo o el perfeccionamiento de los modelos de PNL vietnamitas.

Obtén el dataset
Tamaño

80 GB de texto, formato Markdown sin procesar (UTF-8), línea por documento

Licencia

ODC-por

Descripción

Viet Vault es un corpus de 80 GB de textos vietnamitas extraídos de más de 10 años de vertederos de Common Crawl. Cada texto ha sido filtrado para garantizar la calidad lingüística (vietnamita), la diversidad de fuentes, la eliminación del contenido tóxico y la eliminación de los duplicados. El formato Markdown facilita su uso directo para la formación de modelos.

¿Para qué sirve este conjunto de datos?

  • Modelos lingüísticos previos al entrenamiento en vietnamita (BERT, ROBerta, GPT...)
  • Perfeccionamiento de las tareas de clasificación, reconocimiento de entidades y resumen
  • Estudios lingüísticos y modelización del idioma vietnamita moderno

¿Se puede enriquecer o mejorar?

Sí, VietVault se puede cruzar con corpus anotados para agregar etiquetas supervisadas. También es posible introducir metadatos (fechas, temas, fuente) o dividirlos según los tipos de contenido (noticias, blogs, foros). Su base UTF-8 Markdown simplifica los enriquecimientos.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Texto bruto, listo para usar)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ya filtrado y deduplicado)
🏷️ Riqueza de anotaciones⭐✩✩✩✩ (Sin anotaciones: corpus no supervisado)
📜 Licencia comercial✅ Sí (ODC-By)
👨‍💻 Ideal para principiantes⚠️ Requiere preprocesamiento si se usa supervisado
🔁 Reutilizable para fine-tuning⚡ Excelente para pre- o post-entrenamiento
🌍 Diversidad cultural⚠️ 100 % vietnamita — fuerte coherencia lingüística

🧠 Recomendado para

  • Lingüistas computacionales
  • Proyectos de IA vietnamitas
  • Formación previa regional de LLM

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • PyTorch
  • TensorFlow
  • FastText
  • Tokenizers

💡 Consejo

Usa un tokenizador vietnamita específico (como vnCoreNL) para maximizar la calidad del preprocesamiento previo al entrenamiento.

Preguntas frecuentes

¿Este corpus contiene textos traducidos automáticamente?

No, el conjunto de datos se basa en contenido vietnamita nativo identificado mediante la detección de idioma, sin traducción automática.

¿Se puede usar VietVault para entrenar un modelo multilingüe?

Sí, al integrarlo con otros corpus en diferentes idiomas, VietVault permite enriquecer la cobertura lingüística de un LLM.

¿Es adecuado para uso industrial?

Sí, la licencia ODC-by permite el uso comercial, siempre que las fuentes se atribuyan correctamente (VietVault + Common Crawl).

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.