VietVault : Corpus Vietnamien de Grande Échelle
VietVault es un enorme corpus en vietnamita creado a partir de Common Crawl (2013-2023). Tras detectar el idioma, limpiar, deduplicar y filtrar el contenido tóxico, proporciona una base sólida para el entrenamiento previo o el perfeccionamiento de los modelos de PNL vietnamitas.
80 GB de texto, formato Markdown sin procesar (UTF-8), línea por documento
ODC-por
Descripción
Viet Vault es un corpus de 80 GB de textos vietnamitas extraídos de más de 10 años de vertederos de Common Crawl. Cada texto ha sido filtrado para garantizar la calidad lingüística (vietnamita), la diversidad de fuentes, la eliminación del contenido tóxico y la eliminación de los duplicados. El formato Markdown facilita su uso directo para la formación de modelos.
¿Para qué sirve este conjunto de datos?
- Modelos lingüísticos previos al entrenamiento en vietnamita (BERT, ROBerta, GPT...)
- Perfeccionamiento de las tareas de clasificación, reconocimiento de entidades y resumen
- Estudios lingüísticos y modelización del idioma vietnamita moderno
¿Se puede enriquecer o mejorar?
Sí, VietVault se puede cruzar con corpus anotados para agregar etiquetas supervisadas. También es posible introducir metadatos (fechas, temas, fuente) o dividirlos según los tipos de contenido (noticias, blogs, foros). Su base UTF-8 Markdown simplifica los enriquecimientos.
🔎 En resumen
🧠 Recomendado para
- Lingüistas computacionales
- Proyectos de IA vietnamitas
- Formación previa regional de LLM
🔧 Herramientas compatibles
- Hugging Face Datasets
- PyTorch
- TensorFlow
- FastText
- Tokenizers
💡 Consejo
Usa un tokenizador vietnamita específico (como vnCoreNL) para maximizar la calidad del preprocesamiento previo al entrenamiento.
Preguntas frecuentes
¿Este corpus contiene textos traducidos automáticamente?
No, el conjunto de datos se basa en contenido vietnamita nativo identificado mediante la detección de idioma, sin traducción automática.
¿Se puede usar VietVault para entrenar un modelo multilingüe?
Sí, al integrarlo con otros corpus en diferentes idiomas, VietVault permite enriquecer la cobertura lingüística de un LLM.
¿Es adecuado para uso industrial?
Sí, la licencia ODC-by permite el uso comercial, siempre que las fuentes se atribuyan correctamente (VietVault + Common Crawl).




