MINT-1T HTML
Este conjunto de datos es un componente del proyecto MINT-1T y contiene documentos HTML con texto estructurado y elementos visuales integrados. Se utiliza para entrenar modelos que pueden procesar secuencias de texto e imágenes de forma fluida.
Varios miles de millones de fichas en HTML intercalado (texto + etiquetas), formato Parquet
CC-BY-4.0
Descripción
MINT-1T HTML es un extracto masivo del proyecto MINT-1T, compuesto por documentos HTML ricos en texto estructurado y elementos visuales. Está destinado a entrenar modelos multimodales capaces de razonar en secuencias intercaladas (texto + imagen).
¿Para qué sirve este conjunto de datos?
- Entrene previamente modelos multimodales a gran escala (Idefics2, Chameleon, xGen-MM...)
- Estudie las habilidades de los LLM para administrar estructuras HTML complejas en un contexto multimodal
- Crear agentes que puedan interactuar con contenido web enriquecido
¿Se puede enriquecer o mejorar?
Sí, puede cruzar estos datos con representaciones visuales reales, añadir anotaciones (tipos de elementos HTML, estructura semántica) o incluso completarlos con metadatos en estilos y scripts integrados. Un filtrado más preciso también permite adaptar la formación a casos específicos (accesibilidad, comercio electrónico, etc.).
🔎 En resumen
🧠 Recomendado para
- Investigadores de IA multimodal
- Formación previa en código abierto
- Proyectos de navegación web de LLM
🔧 Herramientas compatibles
- PyTorch
- Hugging Face Datasets
- WebDataset
- Idefics2
- VLLM multimodal
💡 Consejo
Filtre los documentos por tipo de contenido HTML (formularios, tablas, párrafos) para centrarse en las capacidades específicas de la plantilla.
Preguntas frecuentes
¿Este conjunto de datos contiene imágenes o solo HTML textual?
El archivo contiene HTML con una estructura visual integrada (imágenes referenciadas), pero las imágenes en sí mismas no se almacenan directamente aquí.
¿Es posible usarlo para entrenar un modelo de chatbot multimodal?
Sí, es un caso de uso típico de un conjunto de datos: está diseñado para capacitar a los agentes para que puedan razonar sobre documentos enriquecidos.
¿Se puede usar tal cual o se debe filtrar?
Se puede usar directamente, pero filtrar por tipo de contenido HTML puede mejorar la relevancia de acuerdo con el objetivo de la capacitación.




