Clothing1M
Clothing1M es un conjunto de datos de más de un millón de imágenes de ropa de sitios de comercio electrónico. Las etiquetas son ruidosas porque se extraen automáticamente, pero un subconjunto de 74 000 imágenes se anota correctamente con fines de entrenamiento, validación y pruebas.
Más de 1 millón de imágenes JPEG divididas en 14 clases, con datos anotados limpios y ruidosos
Descarga gratuita, licencia no especificada explícitamente
Descripción
Clothing1M es un conjunto de datos a gran escala que contiene más de un millón de imágenes de ropa, divididas en 14 categorías. Las imágenes se recopilaron de varias plataformas de compras en línea, lo que resultó en una alta tasa de etiquetas erróneas. Sin embargo, el conjunto de datos incluye 50 000 imágenes correctamente anotadas para el entrenamiento, 14 000 para la validación y 10 000 para las pruebas.
¿Para qué sirve este conjunto de datos?
- Pruebe la solidez de los modelos de clasificación frente a datos ruidosos
- Experimente con técnicas automáticas de limpieza o reetiquetado
- Modelos de IA de entrenamiento aplicados al comercio electrónico y al reconocimiento de ropa
¿Se puede enriquecer o mejorar?
Sí, puedes refinar las etiquetas, agrupar clases o integrar los metadatos del producto (color, género, estilo). También es posible combinar este conjunto de datos con otros conjuntos de datos sociales o de comercio electrónico para enriquecer las representaciones visuales.
🔎 En resumen
🧠 Recomendado para
- Proyectos de robustez de NLP/Vision
- Investigadores del ruido de etiquetas
- IA de comercio electrónico
🔧 Herramientas compatibles
- PyTorch
- TensorFlow
- FastAI
- Cleanlab
💡 Consejo
Utilice métodos de corrección de etiquetas (aprendizaje seguro) para extraer un subconjunto más fiable.
Preguntas frecuentes
¿Cuál es el principal beneficio de Clothing1M a pesar del ruido de los datos?
Permite evaluar la robustez de los modelos ante anotaciones erróneas, un caso habitual en los datos reales.
¿El conjunto de datos contiene un subconjunto anotado correctamente?
Sí, 50 000 imágenes para la formación, 14 000 para la validación y 10 000 para las pruebas están etiquetadas correctamente.
¿Se puede usar este conjunto de datos para un proyecto comercial?
Dado que la licencia no está especificada, se recomienda ponerse en contacto con los autores para uso comercial.




