Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Coyo 700M
Multimodal

Coyo 700M

Conjunto de datos masivo de pares de imágenes y texto extraídos de documentos HTML, destinado a entrenar modelos básicos de lenguajes de visión multimodales.

Obtén el dataset
Tamaño

Aproximadamente 747 millones de pares de imagen y texto, 135 GB en archivos de Parquet

Licencia

CC-BY 4.0

Descripción

Coyo 700M es un conjunto de datos muy grande que comprende aproximadamente 747 millones de pares de imágenes y textos asociados extraídos de documentos HTML. Cada par va acompañado de metadatos que permiten una variedad de usos en el entrenamiento de modelos de IA multimodales.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos multimodales de lenguaje visual a gran escala
  • Mejorar las habilidades de comprensión visual y textual de los LLM multimodales
  • Complete otros conjuntos de datos para la formación de modelos básicos

¿Se puede enriquecer o mejorar?

El conjunto de datos se puede refinar filtrando, limpiando o volviendo a anotar para mejorar la calidad de los pares. La integración de metadatos adicionales o la traducción de textos también pueden enriquecer el corpus.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐✩✩✩ (Requiere procesamiento masivo y recursos importantes)
🧼 Necesidad de limpieza⭐⭐✩✩✩ (Alto, filtrado necesario para calidad óptima)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Metadatos variados, pero anotaciones básicas)
📜 Licencia comercial✅ CC-BY 4.0 – uso comercial libre
👨‍💻 Ideal para principiantes⚠️ No, volumen y procesamiento complejos
🔁 Reutilizable para fine-tuning✅ Excelente base para modelos multimodales
🌍 Diversidad cultural🌐 Gran diversidad por fuente web mundial

🧠 Recomendado para

  • Investigadores de IA multimodal
  • Desarrolladores de Foundation Models
  • Científicos de datos avanzados

🔧 Herramientas compatibles

  • Apache Spark
  • Hugging Face Datasets
  • TensorFlow
  • PyTorch
  • Dask

💡 Consejo

Priorice el filtrado avanzado para mejorar la calidad del conjunto de datos antes del entrenamiento.

Preguntas frecuentes

¿Cuál es el tamaño exacto del conjunto de datos Coyo 700M?

El conjunto de datos contiene aproximadamente 747 millones de pares de imágenes y texto, que ocupan aproximadamente 135 GB en formato Parquet.

¿Puedo usar este conjunto de datos para uso comercial?

Sí, la licencia CC-BY 4.0 permite el uso comercial siempre que se cite la fuente.

¿Este conjunto de datos es adecuado para principiantes en aprendizaje automático?

No, el tamaño y la complejidad del conjunto de datos requieren recursos y habilidades avanzados.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.