Hate Speech Detection Dataset for Social Media
Conjunto de datos sintético diseñado para entrenar y evaluar modelos de PNL para detectar discursos de odio y ofensivos en las redes sociales. Abarca categorías neutrales, ofensivas y que incitan al odio, con contenido que respeta la privacidad y sin datos reales confidenciales.
1.829 publicaciones en CSV, con campos de texto, etiqueta, plataforma, fecha e ID de usuario
CC0: Dominio público
Descripción
El conjunto de datos Hate Speech Detection Dataset for Social Media incluye 1.829 publicaciones sintéticas de plataformas como Twitter y Reddit, con anotaciones para detectar discursos de odio, ofensivos o neutrales. Los datos también incluyen metadatos como la hora, la plataforma y la identificación de usuario.
¿Para qué sirve este conjunto de datos?
- Entrene modelos de clasificación para la moderación automática en tiempo real
- Evaluación de los canales de PNL para la detección del discurso de odio en las redes sociales
- Contribuir a la investigación sobre la seguridad y la vigilancia del contenido en línea
¿Se puede enriquecer o mejorar?
El conjunto de datos puede ampliarse con ejemplos reales o más grandes y mejorarse con anotaciones más precisas (por ejemplo, grados de intensidad, objetivos específicos). La integración de contextos multilingües también sería beneficiosa.
🔎 En resumen
🧠 Recomendado para
- Investigadores de PNL
- Desarrolladores de sistemas de moderación
- Estudiantes de aprendizaje automático
🔧 Herramientas compatibles
- Scikit-learn
- Hugging Face Transformers
- SpaCy
- TensorFlow
- PyTorch
💡 Consejo
Entrene con conjuntos de datos complementarios para mejorar la solidez en condiciones reales.
Preguntas frecuentes
¿Se puede usar este conjunto de datos para detectar automáticamente la incitación al odio en tiempo real?
Sí, está diseñado específicamente para entrenar y evaluar modelos de clasificación en tiempo real en las redes sociales.
¿Este conjunto de datos contiene datos reales o confidenciales?
No, es un conjunto de datos sintético que garantiza la confidencialidad y la ausencia de contenido verdaderamente sensible.
¿El conjunto de datos cubre varios idiomas?
No, el conjunto de datos está principalmente en inglés y no ofrece anotaciones multilingües.




