VietVault : Corpus Vietnamien de Grande Échelle
VietVault est un corpus massif en vietnamien construit à partir de Common Crawl (2013–2023). Après détection de langue, nettoyage, déduplication et filtrage des contenus toxiques, il constitue une base solide pour pré-entraîner ou affiner des modèles NLP vietnamiens.
80 Go de texte, format Markdown brut (UTF-8), ligne par document
ODC-By
Description
VietVault est un corpus de 80 Go de textes vietnamiens extraits de plus de 10 ans de dumps Common Crawl. Chaque texte a été filtré pour garantir la qualité linguistique (Vietnamien), la diversité des sources, la suppression des contenus toxiques et la suppression des doublons. Le format Markdown facilite une utilisation directe pour l’entraînement de modèles.
À quoi sert ce dataset ?
- Pré-entraîner des modèles de langue en vietnamien (BERT, RoBERTa, GPT...)
- Fine-tuning sur des tâches de classification, reconnaissance d’entités, résumé
- Études linguistiques et modélisation de la langue vietnamienne moderne
Peut-on l’enrichir ou l’améliorer ?
Oui, VietVault peut être croisé avec des corpus annotés pour ajouter des labels supervisés. Il est également possible d’y injecter des métadonnées (dates, thématiques, source) ou de le découper selon les types de contenus (news, blogs, forums). Sa base Markdown UTF-8 simplifie les enrichissements.
🔎 En résumé
🧠 Recommandé pour
- Linguistes computationnels
- Projets IA vietnamiens
- Pré-entraînement de LLM régionaux
🔧 Outils compatibles
- Hugging Face Datasets
- PyTorch
- TensorFlow
- FastText
- Tokenizers
💡 Astuce
Utilisez un tokenizer vietnamien spécifique (comme VnCoreNLP) pour maximiser la qualité du prétraitement avant entraînement.
Questions fréquemment posées
Ce corpus contient-il des textes traduits automatiquement ?
Non, le dataset est basé sur du contenu natif en vietnamien identifié via détection de langue, sans traduction automatique.
Peut-on utiliser VietVault pour entraîner un modèle multilingue ?
Oui, en l’intégrant à d’autres corpus dans différentes langues, VietVault permet d’enrichir la couverture linguistique d’un LLM.
Est-il adapté à une utilisation industrielle ?
Oui, la licence ODC-By autorise un usage commercial, à condition d’attribuer correctement les sources (VietVault + Common Crawl).




