En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Phishing URLs
Texte

Phishing URLs

Ensemble équilibré d’URLs légitimes et frauduleuses, conçu pour la détection de phishing via des méthodes d’analyse automatique.

Télécharger le dataset
Taille

96 018 URLs au format CSV

Licence

Open Database License (ODbL)

Description

Le dataset Phishing URLs contient 96 018 entrées réparties équitablement entre des URLs légitimes et des URLs de phishing. Chaque ligne est représentée par un domaine, un label (0 pour légitime, 1 pour phishing) et un ensemble de caractéristiques calculées selon des métriques issues de l'article de recherche "PhishStorm".

À quoi sert ce dataset ?

  • Entraîner des modèles de classification pour détecter les URLs frauduleuses
  • Tester des algorithmes de sécurité web en temps réel
  • Évaluer des approches de machine learning sur des données binaires équilibrées

Peut-on l’enrichir ou l’améliorer ?

Oui, il est possible de compléter ce jeu de données avec des caractéristiques supplémentaires (ex : WHOIS, géolocalisation IP, historique DNS). Des techniques de feature engineering ou des modèles d’analyse temporelle peuvent également enrichir l’exploitation du dataset.

🔎 En résumé

Critère Évaluation
🧩Facilité d’utilisation ⭐⭐⭐⭐⭐ (Facile à utiliser, format CSV propre)
🧼Besoin de nettoyage ⭐⭐⭐☆☆ (Faible : vérification des doublons ou anomalies)
🏷️Richesse des annotations ⭐⭐⭐⭐☆ (Étiquettes binaires et plusieurs features calculés)
📜Licence commerciale ✅ Oui (ODbL)
👨‍💻Idéal pour les débutants 🧑‍💻 Oui – bonne base pour les projets ML en cybersécurité
🔁Réutilisable en fine-tuning 🛠️ Utilisable pour pré-entraînement ou benchmark
🌍Diversité culturelle 🌍 Non spécifiée mais potentiellement global

🧠 Recommandé pour

  • Projets de cybersécurité
  • Formation à la détection de phishing
  • Classification binaire

🔧 Outils compatibles

  • Scikit-learn
  • Pandas
  • LightGBM
  • XGBoost
  • TensorFlow

💡 Astuce

Utilisez la répartition équilibrée pour expérimenter différentes métriques d’évaluation comme AUC, F1-score et précision/recall.

Questions fréquemment posées

Peut-on utiliser ce dataset pour entraîner un modèle en production ?

Oui, à condition de l’enrichir avec des données plus récentes et d’adapter les features au contexte de votre service web.

Le dataset est-il équilibré entre phishing et non-phishing ?

Oui, il contient exactement 48 009 URLs légitimes et 48 009 URLs de phishing.

Est-il adapté à un apprentissage supervisé ?

Tout à fait, le dataset est étiqueté et formaté pour l'entraînement de modèles supervisés classiques ou avancés.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.