Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Fondant CC 25M
Imagen

Fondant CC 25M

Un amplio conjunto de datos de 25 millones de URL de imágenes extraídas de la web, con información de licencias de Creative Commons, ideal para crear o perfeccionar modelos de generación y visión por computadora.

Obtén el dataset
Tamaño

25 millones de imágenes (a través de URL), metadatos JSON, enlaces y licencia

Licencia

Creative Commons (imágenes individuales bajo licencias CC)

Descripción

Fondant CC 25M es un enorme conjunto de datos de código abierto que contiene 25 millones de URL de imágenes recopiladas de la web mediante Common Crawl. Cada enlace está asociado a una licencia Creative Commons, lo que garantiza la reutilización del contenido. Este conjunto de datos se creó con el marco de Fondant, lo que permite una reproducibilidad eficiente para canalizaciones a gran escala.

¿Para qué sirve este conjunto de datos?

  • Preparación de conjuntos de datos visuales libres de regalías para el entrenamiento de modelos
  • Evalúe modelos para generar o buscar imágenes en condiciones reales
  • Crear corpus de imágenes temáticas (mediante filtrado de dominios, tipos, etc.)

¿Se puede enriquecer o mejorar?

Sí. Este conjunto de datos es una base de datos sin procesar que se puede filtrar, ordenar y enriquecer mediante clasificación, agrupamiento o validación humana. También es posible asociar vectores o metadatos de imágenes adicionales (categorías, colores, fuente...).

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐✩✩✩ (Requiere procesamiento inicial - descarga, filtrado)
🧼 Necesidad de limpieza⭐⭐✩✩✩ (Alto – los enlaces pueden estar rotos o desactualizados)
🏷️ Riqueza de anotaciones⭐⭐✩✩✩ (Limitado – solo URL + licencia)
📜 Licencia comercial⚠️ Sí (según la licencia CC de cada imagen)
👨‍💻 Ideal para principiantes⚠️ No – requiere herramientas de automatización
🔁 Reutilizable para fine-tuning✅ Sí, después de filtrado y procesamiento
🌍 Diversidad cultural🌐 Alto – contenido web global y variado

🧠 Recomendado para

  • Proyectos de generación de imágenes
  • Rastreo personalizado
  • Constitución de conjuntos de datos gratuitos

🔧 Herramientas compatibles

  • Fondant
  • DuckDB
  • FastDownload
  • Datasets Hugging Face
  • PyTorch

💡 Consejo

Filtre las imágenes por dominio (gov, edu, org) para mejorar la confiabilidad y la diversidad cultural.

Preguntas frecuentes

¿Este conjunto de datos contiene las imágenes en sí?

No, solo contiene URL de imágenes disponibles públicamente, con su licencia. Tienes que descargarlas tú mismo.

¿Se puede usar para un proyecto comercial?

Sí, siempre y cuando cada imagen cumpla con la licencia CC asociada. Se recomienda filtrar por tipo de licencia.

¿Es posible filtrar el conjunto de datos antes de usarlo?

Sí, el conjunto de datos es compatible con herramientas como Fondant o Pandas para ordenar por dominio, tipo de imagen, idioma, etc.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.