En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Phishing Email Dataset
Texte

Phishing Email Dataset

Dataset compilant plus de 82 000 emails issus de plusieurs sources, annotés pour la détection de phishing. Les emails contiennent sujet, corps du message, et métadonnées associées. Ce corpus est adapté pour entraîner des modèles de classification et de détection d’attaques par phishing.

Télécharger le dataset
Taille

Environ 82 500 emails au format texte, avec métadonnées (expéditeur, destinataire, date), annotés spam/phishing ou légitimes

Licence

CC BY-SA 4.0

Description

‍

Le dataset Phishing Email Dataset regroupe environ 82 500 emails annotés comme spam/phishing ou légitimes, provenant de diverses bases (Enron, Ling, SpamAssassin, etc.). Il contient le sujet, le corps du message ainsi que des métadonnées telles que l’expéditeur, le destinataire, et la date.

‍

‍

À quoi sert ce dataset ?

‍

  • Entraîner des modèles de détection automatique de phishing et spam par analyse de texte.
  • Étudier les tactiques et caractéristiques des emails frauduleux.
  • Développer des outils de filtrage et de sécurité pour la messagerie électronique.

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, il est possible d’ajouter des annotations supplémentaires, comme la classification par type d’attaque phishing ou la détection d’éléments malveillants spécifiques. Le dataset peut aussi être mis à jour régulièrement avec de nouvelles campagnes.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Corpus bien structuré prêt à l’usage)
🧼 Besoin de nettoyage⭐⭐⭐⭐✩ (Faible à modéré – quelques emails peuvent nécessiter un nettoyage)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne – annotations spam/phishing vs légitime, métadonnées complètes)
📜 Licence commerciale✅ Oui (CC BY-SA 4.0)
👨‍💻 Idéal pour les débutants⚡ Oui, parfait pour projets en classification de texte et sécurité
🔁 Réutilisable en fine-tuning💬 Excellent pour entraînement de modèles NLP anti-phishing
🌍 Diversité culturelle⚠️ Modérée – emails issus de différentes sources et contextes

‍

‍

🧠 Recommandé pour

  • Chercheurs en cybersécurité
  • Développeurs de filtres anti-spam
  • Étudiants NLP

‍

‍

🔧 Outils compatibles

  • TensorFlow
  • PyTorch
  • SpaCy
  • Scikit-learn
  • Email parsing libraries

‍

‍

💡 Astuce

Tester des approches hybrides combinant analyse textuelle et métadonnées pour améliorer la détection.

Questions fréquemment posées

Ce dataset contient-il des emails récents et représentatifs des tactiques actuelles de phishing ?

Le dataset combine plusieurs sources classiques, il est conseillé de compléter avec des données plus récentes pour rester à jour.

Les emails contiennent-ils des pièces jointes ou uniquement du texte ?

Principalement texte avec sujet et corps, les pièces jointes ne sont pas incluses.

Puis-je utiliser ce dataset pour un projet commercial ?

Oui, la licence CC BY-SA 4.0 permet un usage commercial sous conditions de partage à l’identique.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.