En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
VietVault : Corpus Vietnamien de Grande Échelle
Texte

VietVault : Corpus Vietnamien de Grande Échelle

VietVault est un corpus massif en vietnamien construit à partir de Common Crawl (2013–2023). Après détection de langue, nettoyage, déduplication et filtrage des contenus toxiques, il constitue une base solide pour pré-entraîner ou affiner des modèles NLP vietnamiens.

Télécharger le dataset
Taille

80 Go de texte, format Markdown brut (UTF-8), ligne par document

Licence

ODC-By

Description

VietVault est un corpus de 80 Go de textes vietnamiens extraits de plus de 10 ans de dumps Common Crawl. Chaque texte a été filtré pour garantir la qualité linguistique (Vietnamien), la diversité des sources, la suppression des contenus toxiques et la suppression des doublons. Le format Markdown facilite une utilisation directe pour l’entraînement de modèles.

À quoi sert ce dataset ?

  • Pré-entraîner des modèles de langue en vietnamien (BERT, RoBERTa, GPT...)
  • Fine-tuning sur des tâches de classification, reconnaissance d’entités, résumé
  • Études linguistiques et modélisation de la langue vietnamienne moderne

Peut-on l’enrichir ou l’améliorer ?

Oui, VietVault peut être croisé avec des corpus annotés pour ajouter des labels supervisés. Il est également possible d’y injecter des métadonnées (dates, thématiques, source) ou de le découper selon les types de contenus (news, blogs, forums). Sa base Markdown UTF-8 simplifie les enrichissements.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Texte brut, prêt à l’emploi)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Déjà filtré et dédupliqué)
🏷️ Richesse des annotations⭐✩✩✩✩ (Pas d’annotations : corpus non supervisé)
📜 Licence commerciale✅ Oui (ODC-By)
👨‍💻 Idéal pour les débutants⚠️ Requiert prétraitement si usage supervisé
🔁 Réutilisable en fine-tuning⚡ Excellent pour du pré- ou post-entraîne­ment
🌍 Diversité culturelle⚠️ 100 % vietnamien — forte cohérence linguistique

🧠 Recommandé pour

  • Linguistes computationnels
  • Projets IA vietnamiens
  • Pré-entraîne­ment de LLM régionaux

🔧 Outils compatibles

  • Hugging Face Datasets
  • PyTorch
  • TensorFlow
  • FastText
  • Tokenizers

💡 Astuce

Utilisez un tokenizer vietnamien spécifique (comme VnCoreNLP) pour maximiser la qualité du prétraitement avant entraînement.

Questions fréquemment posées

Ce corpus contient-il des textes traduits automatiquement ?

Non, le dataset est basé sur du contenu natif en vietnamien identifié via détection de langue, sans traduction automatique.

Peut-on utiliser VietVault pour entraîner un modèle multilingue ?

Oui, en l’intégrant à d’autres corpus dans différentes langues, VietVault permet d’enrichir la couverture linguistique d’un LLM.

Est-il adapté à une utilisation industrielle ?

Oui, la licence ODC-By autorise un usage commercial, à condition d’attribuer correctement les sources (VietVault + Common Crawl).

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.