Phishing URLs
Ensemble équilibré d’URLs légitimes et frauduleuses, conçu pour la détection de phishing via des méthodes d’analyse automatique.
Description
Le dataset Phishing URLs contient 96 018 entrées réparties équitablement entre des URLs légitimes et des URLs de phishing. Chaque ligne est représentée par un domaine, un label (0 pour légitime, 1 pour phishing) et un ensemble de caractéristiques calculées selon des métriques issues de l'article de recherche "PhishStorm".
À quoi sert ce dataset ?
- Entraîner des modèles de classification pour détecter les URLs frauduleuses
- Tester des algorithmes de sécurité web en temps réel
- Évaluer des approches de machine learning sur des données binaires équilibrées
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible de compléter ce jeu de données avec des caractéristiques supplémentaires (ex : WHOIS, géolocalisation IP, historique DNS). Des techniques de feature engineering ou des modèles d’analyse temporelle peuvent également enrichir l’exploitation du dataset.
🔎 En résumé
🧠 Recommandé pour
- Projets de cybersécurité
- Formation à la détection de phishing
- Classification binaire
🔧 Outils compatibles
- Scikit-learn
- Pandas
- LightGBM
- XGBoost
- TensorFlow
💡 Astuce
Utilisez la répartition équilibrée pour expérimenter différentes métriques d’évaluation comme AUC, F1-score et précision/recall.
Questions fréquemment posées
Peut-on utiliser ce dataset pour entraîner un modèle en production ?
Oui, à condition de l’enrichir avec des données plus récentes et d’adapter les features au contexte de votre service web.
Le dataset est-il équilibré entre phishing et non-phishing ?
Oui, il contient exactement 48 009 URLs légitimes et 48 009 URLs de phishing.
Est-il adapté à un apprentissage supervisé ?
Tout à fait, le dataset est étiqueté et formaté pour l'entraînement de modèles supervisés classiques ou avancés.




