Clickbait Title Classification
Un conjunto de datos textuales compuesto por títulos de artículos anotados como «cebo de clics» o no, diseñado para entrenar modelos de detección automática.
32 000 títulos de prensa, CSV, anotación binaria (clickbait/non-clickbait)
MIT
Descripción
El conjunto de datos Clickbait Title Classification contiene 32 000 títulos de artículos tomados de varios sitios, algunos de los cuales son conocidos por publicar contenido «pegadizo». Cada título está anotado como clickbait (1) o non-clickbait (0). Se deriva de un proyecto de investigación sobre la detección automática del cebo de clics en los medios en línea.
¿Para qué sirve este conjunto de datos?
- Entrene un modelo de clasificación para textos cortos (binario)
- Análisis de las estrategias lingüísticas del clickbait en la prensa online
- Evalúe o perfeccione los modelos de detección automática (por ejemplo, para moderación, SEO, etc.)
¿Se puede enriquecer o mejorar?
Sí Es posible combinarlo con datos contextuales (fuente, fecha, porcentaje de clics) o refinar las anotaciones (grado de cebo de clics, tipos de formulaciones, emoción despertada). También se pueden añadir variantes multilingües para proyectos internacionales.
🔎 En resumen
🧠 Recomendado para
- Estudiantes de PNL
- Ingenieros de IA que trabajan en contenido editorial o de moderación
- Investigadores en comunicación digital
🔧 Herramientas compatibles
- Scikit-learn
- Pandas
- TensorFlow
- Hugging Face Transformers
💡 Consejo
Para mejorar la solidez del modelo, cruce este conjunto de datos con datos en tiempo real (RSS, redes sociales) y enriquezca con incrustaciones contextuales como BERT.
Preguntas frecuentes
¿Este conjunto de datos contiene las fuentes de los títulos analizados?
No, solo se proporcionan oraciones con su anotación, pero algunas fuentes típicas (BuzzFeed, etc.) se mencionan en el estudio asociado.
¿Se puede usar para detectar títulos engañosos en francés?
No directamente, pero la estructura se puede usar como base para crear un conjunto de datos multilingüe equivalente o traducir títulos para ajustarlos.
¿Este conjunto de datos es adecuado para un proyecto de clasificación con pocos recursos?
Sí, es un excelente punto de partida para proyectos ligeros con modelos clásicos o comprimidos (por ejemplo, regresión logística, Distilbert).




