En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
MINT-1T HTML
Multimodal

MINT-1T HTML

Ce dataset est une composante du projet MINT-1T, contenant des documents HTML avec texte structuré et éléments visuels intégrés. Il sert à entraîner des modèles capables de traiter des séquences texte-image de manière fluide.

Télécharger le dataset
Taille

Plusieurs milliards de tokens en HTML intercalé (texte + balises), format Parquet

Licence

CC-BY-4.0

Description

MINT-1T HTML est un extrait massif du projet MINT-1T, composé de documents HTML riches en texte structuré et éléments visuels. Il est destiné à l’entraînement de modèles multimodaux capables de raisonner sur des séquences intercalées (texte + image).

À quoi sert ce dataset ?

  • Pré-entraîner des modèles multimodaux à large échelle (Idefics2, Chameleon, XGen-MM...)
  • Étudier les capacités des LLMs à gérer des structures HTML complexes dans un contexte multimodal
  • Construire des agents capables d’interagir avec du contenu web riche

Peut-on l’enrichir ou l’améliorer ?

Oui, on peut croiser ces données avec des représentations visuelles réelles, ajouter des annotations (types d’éléments HTML, structure sémantique), ou encore les compléter par des métadonnées sur les styles et scripts intégrés. Un filtrage plus fin permet aussi d’adapter l’entraînement à des cas spécifiques (accessibilité, e-commerce, etc.).

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐✩✩✩ (Requiert une infrastructure adaptée au volume)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – corpus déjà structuré - HTML/Parquet)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Structure HTML native riche mais sans méta-annotations)
📜 Licence commerciale✅ Oui (CC-BY-4.0)
👨‍💻 Idéal pour les débutants⚡ Non – nécessite des compétences avancées en traitement multimodal
🔁 Réutilisable en fine-tuning🎯 Idéal pour affiner des modèles comme Chameleon ou Idefics
🌍 Diversité culturelle🌎 Source variée, globalement représentative du web

🧠 Recommandé pour

  • Chercheurs en IA multimodale
  • Pré-entraînement open-source
  • Projets de navigation web par LLM

🔧 Outils compatibles

  • PyTorch
  • Hugging Face Datasets
  • WebDataset
  • Idefics2
  • VLLM multimodal

💡 Astuce

Filtrer les documents par type de contenu HTML (formulaires, tableaux, paragraphes) pour cibler des capacités spécifiques du modèle.

Questions fréquemment posées

Ce dataset contient-il des images ou uniquement du HTML textuel ?

Le fichier contient du HTML avec structure visuelle intégrée (images référencées), mais les images elles-mêmes ne sont pas stockées directement ici.

Est-il possible de l’utiliser pour entraîner un modèle type chatbot multimodal ?

Oui, c’est un cas d’usage typique du dataset : il est conçu pour entraîner des agents capables de raisonner sur des documents riches.

Peut-on l’utiliser tel quel ou faut-il le filtrer ?

Il est exploitable directement, mais un filtrage par type de contenu HTML peut améliorer la pertinence selon l’objectif d’entraînement.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.