Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Clickbait Title Classification
Texto

Clickbait Title Classification

Un conjunto de datos textuales compuesto por títulos de artículos anotados como «cebo de clics» o no, diseñado para entrenar modelos de detección automática.

Obtén el dataset
Tamaño

32 000 títulos de prensa, CSV, anotación binaria (clickbait/non-clickbait)

Licencia

MIT

Descripción

El conjunto de datos Clickbait Title Classification contiene 32 000 títulos de artículos tomados de varios sitios, algunos de los cuales son conocidos por publicar contenido «pegadizo». Cada título está anotado como clickbait (1) o non-clickbait (0). Se deriva de un proyecto de investigación sobre la detección automática del cebo de clics en los medios en línea.

¿Para qué sirve este conjunto de datos?

  • Entrene un modelo de clasificación para textos cortos (binario)
  • Análisis de las estrategias lingüísticas del clickbait en la prensa online
  • Evalúe o perfeccione los modelos de detección automática (por ejemplo, para moderación, SEO, etc.)

¿Se puede enriquecer o mejorar?

Sí Es posible combinarlo con datos contextuales (fuente, fecha, porcentaje de clics) o refinar las anotaciones (grado de cebo de clics, tipos de formulaciones, emoción despertada). También se pueden añadir variantes multilingües para proyectos internacionales.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Estructura simple y anotaciones listas)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ninguna limpieza requerida)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Solo binario, pero fiable)
📜 Licencia comercial✅ Sí (MIT)
👨‍💻 Ideal para principiantes👍 Perfecto para empezar en NLP supervisado
🔁 Reutilizable para fine-tuning⚠️ Útil para adaptar un modelo a la detección de intención
🌍 Diversidad cultural⚠️ Principalmente anglófono, pero estructura transferible

🧠 Recomendado para

  • Estudiantes de PNL
  • Ingenieros de IA que trabajan en contenido editorial o de moderación
  • Investigadores en comunicación digital

🔧 Herramientas compatibles

  • Scikit-learn
  • Pandas
  • TensorFlow
  • Hugging Face Transformers

💡 Consejo

Para mejorar la solidez del modelo, cruce este conjunto de datos con datos en tiempo real (RSS, redes sociales) y enriquezca con incrustaciones contextuales como BERT.

Preguntas frecuentes

¿Este conjunto de datos contiene las fuentes de los títulos analizados?

No, solo se proporcionan oraciones con su anotación, pero algunas fuentes típicas (BuzzFeed, etc.) se mencionan en el estudio asociado.

¿Se puede usar para detectar títulos engañosos en francés?

No directamente, pero la estructura se puede usar como base para crear un conjunto de datos multilingüe equivalente o traducir títulos para ajustarlos.

¿Este conjunto de datos es adecuado para un proyecto de clasificación con pocos recursos?

Sí, es un excelente punto de partida para proyectos ligeros con modelos clásicos o comprimidos (por ejemplo, regresión logística, Distilbert).

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.