Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Phishing Email Dataset
Texto

Phishing Email Dataset

Conjunto de datos que compila más de 82 000 correos electrónicos de varias fuentes, anotados para la detección de suplantación de identidad. Los correos electrónicos contienen el asunto, el cuerpo del mensaje y los metadatos asociados. Este corpus es adecuado para modelos de entrenamiento para la clasificación y detección de ataques de suplantación de identidad.

Obtén el dataset
Tamaño

Aproximadamente 82.500 correos electrónicos en formato de texto, con metadatos (remitente, destinatario, fecha), spam o suplantación de identidad anotados o legítimos

Licencia

CC BY-SA 4.0

Descripción

‍

El conjunto de datos Conjunto de datos de correo electrónico de incluye aproximadamente 82.500 correos electrónicos anotados como spam, suplantación de identidad o legítimos, de varias bases de datos (Enron, Ling, SpamAssassin, etc.). Contiene el asunto, el cuerpo del mensaje y metadatos, como el remitente, el destinatario y la fecha.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos automáticos de detección de spam y suplantación de identidad mediante el análisis de texto.
  • Estudie las tácticas y características de los correos electrónicos fraudulentos.
  • Desarrolle herramientas de filtrado y seguridad para el correo electrónico.

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, es posible añadir anotaciones adicionales, como la clasificación por tipo de ataque de suplantación de identidad o la detección de elementos maliciosos específicos. El conjunto de datos también se puede actualizar periódicamente con nuevas campañas.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Corpus bien estructurado listo para usar)
🧼 Necesidad de limpieza⭐⭐⭐⭐✩ (Bajo a moderado – algunos emails pueden requerir limpieza)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno – anotaciones spam/phishing vs legítimo, metadatos completos)
📜 Licencia comercial✅ Sí (CC BY-SA 4.0)
👨‍💻 Ideal para principiantes⚡ Sí, perfecto para proyectos de clasificación de texto y seguridad
🔁 Reutilizable para fine-tuning💬 Excelente para entrenamiento de modelos NLP anti-phishing
🌍 Diversidad cultural⚠️ Moderado – emails de diferentes fuentes y contextos

‍

‍

🧠 Recomendado para

  • Investigadores de ciberseguridad
  • Desarrolladores de filtros de spam
  • Estudiantes de PNL

‍

‍

🔧 Herramientas compatibles

  • TensorFlow
  • PyTorch
  • Espacio Y
  • Scikit-learn
  • Bibliotecas de análisis de correo electrónico

‍

‍

💡 Consejo

Pruebe enfoques híbridos que combinen análisis textual y metadatos para mejorar la detección.

Preguntas frecuentes

¿Este conjunto de datos contiene correos electrónicos recientes que sean representativos de las tácticas de suplantación de identidad actuales?

El conjunto de datos combina varias fuentes tradicionales, es recomendable completarlo con datos más recientes para mantenerse actualizado.

¿Los correos electrónicos contienen archivos adjuntos o solo texto?

Principalmente texto con asunto y cuerpo, los archivos adjuntos no están incluidos.

¿Puedo usar este conjunto de datos para un proyecto comercial?

Sí, la licencia CC BY-SA 4.0 permite el uso comercial en condiciones de uso compartido idénticas.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.