MINT-1T HTML
Ce dataset est une composante du projet MINT-1T, contenant des documents HTML avec texte structuré et éléments visuels intégrés. Il sert à entraîner des modèles capables de traiter des séquences texte-image de manière fluide.
Plusieurs milliards de tokens en HTML intercalé (texte + balises), format Parquet
CC-BY-4.0
Description
MINT-1T HTML est un extrait massif du projet MINT-1T, composé de documents HTML riches en texte structuré et éléments visuels. Il est destiné à l’entraînement de modèles multimodaux capables de raisonner sur des séquences intercalées (texte + image).
À quoi sert ce dataset ?
- Pré-entraîner des modèles multimodaux à large échelle (Idefics2, Chameleon, XGen-MM...)
- Étudier les capacités des LLMs à gérer des structures HTML complexes dans un contexte multimodal
- Construire des agents capables d’interagir avec du contenu web riche
Peut-on l’enrichir ou l’améliorer ?
Oui, on peut croiser ces données avec des représentations visuelles réelles, ajouter des annotations (types d’éléments HTML, structure sémantique), ou encore les compléter par des métadonnées sur les styles et scripts intégrés. Un filtrage plus fin permet aussi d’adapter l’entraînement à des cas spécifiques (accessibilité, e-commerce, etc.).
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en IA multimodale
- Pré-entraînement open-source
- Projets de navigation web par LLM
🔧 Outils compatibles
- PyTorch
- Hugging Face Datasets
- WebDataset
- Idefics2
- VLLM multimodal
💡 Astuce
Filtrer les documents par type de contenu HTML (formulaires, tableaux, paragraphes) pour cibler des capacités spécifiques du modèle.
Questions fréquemment posées
Ce dataset contient-il des images ou uniquement du HTML textuel ?
Le fichier contient du HTML avec structure visuelle intégrée (images référencées), mais les images elles-mêmes ne sont pas stockées directement ici.
Est-il possible de l’utiliser pour entraîner un modèle type chatbot multimodal ?
Oui, c’est un cas d’usage typique du dataset : il est conçu pour entraîner des agents capables de raisonner sur des documents riches.
Peut-on l’utiliser tel quel ou faut-il le filtrer ?
Il est exploitable directement, mais un filtrage par type de contenu HTML peut améliorer la pertinence selon l’objectif d’entraînement.



