En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Clickbait Title Classification
Texte

Clickbait Title Classification

Dataset textuel composé de titres d’articles annotés comme étant "clickbait" ou non, conçu pour entraîner des modèles de détection automatique.

Télécharger le dataset
Taille

32 000 titres de presse, CSV, annotation binaire (clickbait / non-clickbait)

Licence

MIT

Description

Le dataset Clickbait Title Classification contient 32 000 titres d’articles extraits de divers sites, certains reconnus pour publier des contenus "accrocheurs". Chaque titre est annoté comme clickbait (1) ou non-clickbait (0). Il est dérivé d’un projet de recherche sur la détection automatique de clickbait dans les médias en ligne.

À quoi sert ce dataset ?

  • Entraîner un modèle de classification de textes courts (binaire)
  • Analyser les stratégies linguistiques du clickbait dans la presse en ligne
  • Évaluer ou affiner des modèles de détection automatique (e.g. pour modération, SEO, etc.)

Peut-on l’enrichir ou l’améliorer ?

Oui. Il est possible de le croiser avec des données contextuelles (source, date, taux de clics) ou de raffiner les annotations (degré de clickbait, types de formulations, émotion suscitée). On peut aussi y ajouter des variantes multilingues pour des projets internationaux.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Structure simple et annotations prêtes)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Aucun nettoyage requis)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Binaire uniquement, mais fiable)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants👍 Parfait pour démarrer en NLP supervisé
🔁 Réutilisable en fine-tuning⚠️ Utile pour adapter un modèle à la détection d’intention
🌍 Diversité culturelle⚠️ Principalement anglophone, mais structure transférable

🧠 Recommandé pour

  • Étudiants en NLP
  • Ingénieurs IA travaillant sur la modération ou le contenu éditorial
  • Chercheurs en communication numérique

🔧 Outils compatibles

  • Scikit-learn
  • Pandas
  • TensorFlow
  • Hugging Face Transformers

💡 Astuce

Pour améliorer la robustesse du modèle, croisez ce dataset avec des données en temps réel (RSS, réseaux sociaux) et enrichissez avec des embeddings contextuels comme BERT.

Questions fréquemment posées

Ce dataset contient-il les sources des titres analysés ?

Non, seules les phrases sont fournies avec leur annotation, mais certaines sources typiques (BuzzFeed, etc.) sont mentionnées dans l’étude associée.

Peut-on l’utiliser pour détecter des titres trompeurs en français ?

Pas directement, mais la structure peut servir de base pour créer un dataset équivalent multilingue ou traduire les titres pour un fine-tuning.

Ce dataset est-il adapté à un projet de classification avec peu de ressources ?

Oui, c’est un excellent point de départ pour les projets légers avec des modèles classiques ou compressés (e.g. logistic regression, DistilBERT).

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.