Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Clothing1M
Imagen

Clothing1M

Clothing1M es un conjunto de datos de más de un millón de imágenes de ropa de sitios de comercio electrónico. Las etiquetas son ruidosas porque se extraen automáticamente, pero un subconjunto de 74 000 imágenes se anota correctamente con fines de entrenamiento, validación y pruebas.

Obtén el dataset
Tamaño

Más de 1 millón de imágenes JPEG divididas en 14 clases, con datos anotados limpios y ruidosos

Licencia

Descarga gratuita, licencia no especificada explícitamente

Descripción

‍

Clothing1M es un conjunto de datos a gran escala que contiene más de un millón de imágenes de ropa, divididas en 14 categorías. Las imágenes se recopilaron de varias plataformas de compras en línea, lo que resultó en una alta tasa de etiquetas erróneas. Sin embargo, el conjunto de datos incluye 50 000 imágenes correctamente anotadas para el entrenamiento, 14 000 para la validación y 10 000 para las pruebas.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Pruebe la solidez de los modelos de clasificación frente a datos ruidosos
  • Experimente con técnicas automáticas de limpieza o reetiquetado
  • Modelos de IA de entrenamiento aplicados al comercio electrónico y al reconocimiento de ropa

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, puedes refinar las etiquetas, agrupar clases o integrar los metadatos del producto (color, género, estilo). También es posible combinar este conjunto de datos con otros conjuntos de datos sociales o de comercio electrónico para enriquecer las representaciones visuales.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Volumen grande, requiere filtrado previo)
🧼 Necesidad de limpieza⭐⭐✩✩✩ (Alto: presencia masiva de etiquetas erróneas)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Bajo en general, limpio en un subconjunto)
📜 Licencia comercial⚠️ No especificada, verificar según uso específico
👨‍💻 Ideal para principiantes⚠️ Moderado, bueno para experimentar pero puede ser complejo de usar
🔁 Reutilizable para fine-tuning✅ Muy adecuado para fine-tuning de modelos robustos
🌍 Diversidad cultural⚠️ Bajo: estilos de plataformas de e-commerce asiáticas y occidentales

‍

‍

🧠 Recomendado para

  • Proyectos de robustez de NLP/Vision
  • Investigadores del ruido de etiquetas
  • IA de comercio electrónico

‍

‍

🔧 Herramientas compatibles

  • PyTorch
  • TensorFlow
  • FastAI
  • Cleanlab

‍

‍

💡 Consejo

Utilice métodos de corrección de etiquetas (aprendizaje seguro) para extraer un subconjunto más fiable.

Preguntas frecuentes

¿Cuál es el principal beneficio de Clothing1M a pesar del ruido de los datos?

Permite evaluar la robustez de los modelos ante anotaciones erróneas, un caso habitual en los datos reales.

¿El conjunto de datos contiene un subconjunto anotado correctamente?

Sí, 50 000 imágenes para la formación, 14 000 para la validación y 10 000 para las pruebas están etiquetadas correctamente.

¿Se puede usar este conjunto de datos para un proyecto comercial?

Dado que la licencia no está especificada, se recomienda ponerse en contacto con los autores para uso comercial.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.