Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Phishing URLs
Texto

Phishing URLs

Un conjunto equilibrado de URL legítimas y fraudulentas, diseñado para la detección de suplantación de identidad mediante métodos de análisis automáticos.

Obtén el dataset
Tamaño

96.018 URL en formato CSV

Licencia

Licencia de base de datos abierta (ODbl)

Descripción

El conjunto de datos Phishing URLs contiene 96.018 entradas divididas en partes iguales entre URL legítimas y URL de suplantación de identidad. Cada línea está representada por un dominio, una etiqueta (0 para las legítimas y 1 para las de suplantación de identidad) y un conjunto de características calculadas según las métricas del artículo de investigación «PhishStorm».

¿Para qué sirve este conjunto de datos?

  • Entrene modelos de clasificación para detectar URL fraudulentas
  • Probar algoritmos de seguridad web en tiempo real
  • Evalúe los enfoques de aprendizaje automático en datos binarios balanceados

¿Se puede enriquecer o mejorar?

Sí, es posible completar este conjunto de datos con características adicionales (por ejemplo, WHOIS, geolocalización de IP, historial de DNS). Las técnicas de ingeniería de características o los modelos de análisis temporal también pueden enriquecer la explotación del conjunto de datos.

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐⭐⭐ (Fácil de usar, formato CSV limpio)
🧼Necesidad de limpieza ⭐⭐⭐☆☆ (Baja – verificación de duplicados o anomalías)
🏷️Riqueza de anotaciones ⭐⭐⭐⭐☆ (Etiquetas binarias y múltiples características calculadas)
📜Licencia comercial ✅ Sí (ODbL)
👨‍💻Ideal para principiantes 🧑‍💻 Sí – buena base para proyectos de ML en ciberseguridad
🔁Reutilizable para fine-tuning 🛠️ Utilizable para preentrenamiento o benchmarking
🌍Diversidad cultural 🌍 No especificada, pero potencialmente global

🧠 Recomendado para

  • Proyectos de ciberseguridad
  • Entrenamiento en detección de suplantación
  • Clasificación binaria

🔧 Herramientas compatibles

  • Scikit-learn
  • Pandas
  • LightGBM
  • XGBoost
  • TensorFlow

💡 Consejo

Utilice la distribución equilibrada para experimentar con diferentes métricas de evaluación, como el AUC, la puntuación F1 y la precisión/recuperación.

Preguntas frecuentes

¿Se puede usar este conjunto de datos para entrenar un modelo en producción?

Sí, siempre y cuando lo enriquezca con datos más recientes y adapte las funciones al contexto de su servicio web.

¿El conjunto de datos está equilibrado entre la suplantación de identidad y la no suplantación de identidad?

Sí, contiene exactamente 48.009 URL legítimas y 48.009 URL de suplantación de identidad.

¿Es adecuado para el aprendizaje supervisado?

De hecho, el conjunto de datos está etiquetado y formateado para entrenar modelos supervisados clásicos o avanzados.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.