Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Amazon Polarity
Texto

Amazon Polarity

Conjunto de datos que contiene reseñas de productos de Amazon de más de 18 años, con anotaciones positivas o negativas. Cada ejemplo incluye un título, contenido de texto y una etiqueta de polaridad. Ideal para entrenar modelos de clasificación de sentimientos.

Obtén el dataset
Tamaño

Alrededor de 4 millones de reseñas (tren y prueba), formato JSON con campos de título, contenido y etiquetas binarias

Licencia

Apache 2.0

Descripción

Amazon Polarity es un corpus masivo de reseñas de clientes de habla inglesa, anotadas para clasificar los sentimientos en positivos o negativos. Los datos abarcan un período de 18 años e incluyen los títulos y el contenido de las reseñas.

¿Para qué sirve este conjunto de datos?

  • Modelos de clasificación de sentimientos de formación para el comercio electrónico
  • Mejore los sistemas de análisis y recomendación de comentarios de los clientes
  • Pruebe la solidez de los modelos de PNL en grandes cantidades de datos reales

¿Se puede enriquecer o mejorar?

El conjunto de datos puede enriquecerse añadiendo anotaciones más precisas (por ejemplo, aspectos específicos de los productos) o combinarse con otras fuentes de reseñas para crear corpus multilingües.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Datos bien estructurados, formato JSON simple)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos textuales listos para usar)
🏷️ Riqueza de anotaciones⭐⭐✩✩✩ (Binario - positivo/negativo, básico pero eficaz)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes🌟 Sí, excelente para aprender clasificación
🔁 Reutilizable para fine-tuning🎯 Perfecto para fine-tuning de modelos NLP
🌍 Diversidad cultural⚠️ Inglés, amplio rango de productos y categorías

🧠 Recomendado para

  • Científicos de datos
  • programadores de PNL
  • Investigadores de análisis de sentimientos

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • TensorFlow
  • PyTorch
  • Scikit-learn

💡 Consejo

Combine este conjunto de datos con revisiones detalladas para obtener un aprendizaje más contextual y preciso.

Preguntas frecuentes

¿Este conjunto de datos cubre varios idiomas?

No, la mayoría de las reseñas están en inglés.

¿Qué etiquetas se utilizan para la clasificación?

Dos etiquetas binarias: 0 para negativo (notas 1 y 2), 1 para positivo (notas 4 y 5).

¿Se puede usar este conjunto de datos para tareas distintas de la clasificación de sentimientos?

Diseñado principalmente para la clasificación de sentimientos, pero se puede aprovechar para el análisis general de textos.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.