Coyo 700M
Conjunto de datos masivo de pares de imágenes y texto extraídos de documentos HTML, destinado a entrenar modelos básicos de lenguajes de visión multimodales.
Aproximadamente 747 millones de pares de imagen y texto, 135 GB en archivos de Parquet
CC-BY 4.0
Descripción
Coyo 700M es un conjunto de datos muy grande que comprende aproximadamente 747 millones de pares de imágenes y textos asociados extraídos de documentos HTML. Cada par va acompañado de metadatos que permiten una variedad de usos en el entrenamiento de modelos de IA multimodales.
¿Para qué sirve este conjunto de datos?
- Entrene modelos multimodales de lenguaje visual a gran escala
- Mejorar las habilidades de comprensión visual y textual de los LLM multimodales
- Complete otros conjuntos de datos para la formación de modelos básicos
¿Se puede enriquecer o mejorar?
El conjunto de datos se puede refinar filtrando, limpiando o volviendo a anotar para mejorar la calidad de los pares. La integración de metadatos adicionales o la traducción de textos también pueden enriquecer el corpus.
🔎 En resumen
🧠 Recomendado para
- Investigadores de IA multimodal
- Desarrolladores de Foundation Models
- Científicos de datos avanzados
🔧 Herramientas compatibles
- Apache Spark
- Hugging Face Datasets
- TensorFlow
- PyTorch
- Dask
💡 Consejo
Priorice el filtrado avanzado para mejorar la calidad del conjunto de datos antes del entrenamiento.
Preguntas frecuentes
¿Cuál es el tamaño exacto del conjunto de datos Coyo 700M?
El conjunto de datos contiene aproximadamente 747 millones de pares de imágenes y texto, que ocupan aproximadamente 135 GB en formato Parquet.
¿Puedo usar este conjunto de datos para uso comercial?
Sí, la licencia CC-BY 4.0 permite el uso comercial siempre que se cite la fuente.
¿Este conjunto de datos es adecuado para principiantes en aprendizaje automático?
No, el tamaño y la complejidad del conjunto de datos requieren recursos y habilidades avanzados.




