Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
MINT-1T HTML
Multimodal

MINT-1T HTML

Este conjunto de datos es un componente del proyecto MINT-1T y contiene documentos HTML con texto estructurado y elementos visuales integrados. Se utiliza para entrenar modelos que pueden procesar secuencias de texto e imágenes de forma fluida.

Obtén el dataset
Tamaño

Varios miles de millones de fichas en HTML intercalado (texto + etiquetas), formato Parquet

Licencia

CC-BY-4.0

Descripción

MINT-1T HTML es un extracto masivo del proyecto MINT-1T, compuesto por documentos HTML ricos en texto estructurado y elementos visuales. Está destinado a entrenar modelos multimodales capaces de razonar en secuencias intercaladas (texto + imagen).

¿Para qué sirve este conjunto de datos?

  • Entrene previamente modelos multimodales a gran escala (Idefics2, Chameleon, xGen-MM...)
  • Estudie las habilidades de los LLM para administrar estructuras HTML complejas en un contexto multimodal
  • Crear agentes que puedan interactuar con contenido web enriquecido

¿Se puede enriquecer o mejorar?

Sí, puede cruzar estos datos con representaciones visuales reales, añadir anotaciones (tipos de elementos HTML, estructura semántica) o incluso completarlos con metadatos en estilos y scripts integrados. Un filtrado más preciso también permite adaptar la formación a casos específicos (accesibilidad, comercio electrónico, etc.).

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐✩✩✩ (Requiere infraestructura adaptada al volumen)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – corpus ya estructurado - HTML/Parquet)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Estructura HTML nativa rica pero sin meta-anotaciones)
📜 Licencia comercial✅ Sí (CC-BY-4.0)
👨‍💻 Ideal para principiantes⚡ No – requiere habilidades avanzadas en procesamiento multimodal
🔁 Reutilizable para fine-tuning🎯 Ideal para afinar modelos como Chameleon o Idefics
🌍 Diversidad cultural🌎 Fuente variada, globalmente representativa de la web

🧠 Recomendado para

  • Investigadores de IA multimodal
  • Formación previa en código abierto
  • Proyectos de navegación web de LLM

🔧 Herramientas compatibles

  • PyTorch
  • Hugging Face Datasets
  • WebDataset
  • Idefics2
  • VLLM multimodal

💡 Consejo

Filtre los documentos por tipo de contenido HTML (formularios, tablas, párrafos) para centrarse en las capacidades específicas de la plantilla.

Preguntas frecuentes

¿Este conjunto de datos contiene imágenes o solo HTML textual?

El archivo contiene HTML con una estructura visual integrada (imágenes referenciadas), pero las imágenes en sí mismas no se almacenan directamente aquí.

¿Es posible usarlo para entrenar un modelo de chatbot multimodal?

Sí, es un caso de uso típico de un conjunto de datos: está diseñado para capacitar a los agentes para que puedan razonar sobre documentos enriquecidos.

¿Se puede usar tal cual o se debe filtrar?

Se puede usar directamente, pero filtrar por tipo de contenido HTML puede mejorar la relevancia de acuerdo con el objetivo de la capacitación.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.