Clickbait Title Classification
Dataset textuel composé de titres d’articles annotés comme étant "clickbait" ou non, conçu pour entraîner des modèles de détection automatique.
32 000 titres de presse, CSV, annotation binaire (clickbait / non-clickbait)
MIT
Description
Le dataset Clickbait Title Classification contient 32 000 titres d’articles extraits de divers sites, certains reconnus pour publier des contenus "accrocheurs". Chaque titre est annoté comme clickbait (1) ou non-clickbait (0). Il est dérivé d’un projet de recherche sur la détection automatique de clickbait dans les médias en ligne.
À quoi sert ce dataset ?
- Entraîner un modèle de classification de textes courts (binaire)
- Analyser les stratégies linguistiques du clickbait dans la presse en ligne
- Évaluer ou affiner des modèles de détection automatique (e.g. pour modération, SEO, etc.)
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible de le croiser avec des données contextuelles (source, date, taux de clics) ou de raffiner les annotations (degré de clickbait, types de formulations, émotion suscitée). On peut aussi y ajouter des variantes multilingues pour des projets internationaux.
🔎 En résumé
🧠 Recommandé pour
- Étudiants en NLP
- Ingénieurs IA travaillant sur la modération ou le contenu éditorial
- Chercheurs en communication numérique
🔧 Outils compatibles
- Scikit-learn
- Pandas
- TensorFlow
- Hugging Face Transformers
💡 Astuce
Pour améliorer la robustesse du modèle, croisez ce dataset avec des données en temps réel (RSS, réseaux sociaux) et enrichissez avec des embeddings contextuels comme BERT.
Questions fréquemment posées
Ce dataset contient-il les sources des titres analysés ?
Non, seules les phrases sont fournies avec leur annotation, mais certaines sources typiques (BuzzFeed, etc.) sont mentionnées dans l’étude associée.
Peut-on l’utiliser pour détecter des titres trompeurs en français ?
Pas directement, mais la structure peut servir de base pour créer un dataset équivalent multilingue ou traduire les titres pour un fine-tuning.
Ce dataset est-il adapté à un projet de classification avec peu de ressources ?
Oui, c’est un excellent point de départ pour les projets légers avec des modèles classiques ou compressés (e.g. logistic regression, DistilBERT).




