Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Hate Speech Detection Dataset for Social Media
Texto

Hate Speech Detection Dataset for Social Media

Conjunto de datos sintético diseñado para entrenar y evaluar modelos de PNL para detectar discursos de odio y ofensivos en las redes sociales. Abarca categorías neutrales, ofensivas y que incitan al odio, con contenido que respeta la privacidad y sin datos reales confidenciales.

Obtén el dataset
Tamaño

1.829 publicaciones en CSV, con campos de texto, etiqueta, plataforma, fecha e ID de usuario

Licencia

CC0: Dominio público

Descripción

El conjunto de datos Hate Speech Detection Dataset for Social Media incluye 1.829 publicaciones sintéticas de plataformas como Twitter y Reddit, con anotaciones para detectar discursos de odio, ofensivos o neutrales. Los datos también incluyen metadatos como la hora, la plataforma y la identificación de usuario.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos de clasificación para la moderación automática en tiempo real
  • Evaluación de los canales de PNL para la detección del discurso de odio en las redes sociales
  • Contribuir a la investigación sobre la seguridad y la vigilancia del contenido en línea

¿Se puede enriquecer o mejorar?

El conjunto de datos puede ampliarse con ejemplos reales o más grandes y mejorarse con anotaciones más precisas (por ejemplo, grados de intensidad, objetivos específicos). La integración de contextos multilingües también sería beneficiosa.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Formato CSV simple, listo para usar)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos sintéticos bien estructurados)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Tres clases claras, sin anotaciones complejas)
📜 Licencia comercial✅ Sí (CC0)
👨‍💻 Ideal para principiantes✅ Sí, accesible para primeros proyectos de NLP
🔁 Reutilizable para fine-tuning📝 Adecuado para fine-tuning de modelos de detección
🌍 Diversidad cultural⚠️ Sintético, sin indicación específica sobre diversidad lingüística

🧠 Recomendado para

  • Investigadores de PNL
  • Desarrolladores de sistemas de moderación
  • Estudiantes de aprendizaje automático

🔧 Herramientas compatibles

  • Scikit-learn
  • Hugging Face Transformers
  • SpaCy
  • TensorFlow
  • PyTorch

💡 Consejo

Entrene con conjuntos de datos complementarios para mejorar la solidez en condiciones reales.

Preguntas frecuentes

¿Se puede usar este conjunto de datos para detectar automáticamente la incitación al odio en tiempo real?

Sí, está diseñado específicamente para entrenar y evaluar modelos de clasificación en tiempo real en las redes sociales.

¿Este conjunto de datos contiene datos reales o confidenciales?

No, es un conjunto de datos sintético que garantiza la confidencialidad y la ausencia de contenido verdaderamente sensible.

¿El conjunto de datos cubre varios idiomas?

No, el conjunto de datos está principalmente en inglés y no ofrece anotaciones multilingües.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.