Published April 17, 2025 | Version v1

Multiclass NLP Dataset for Phishing and Social Engineering Threat Detection

Contributors

  • 1. Engineering Ingegneria Informatica

Description

This dataset contains 624 English-language messages for training and evaluating phishing detection models using Natural Language Processing (NLP). Each message is labeled with one of six classes related to cybersecurity threats or benign content.

The file is in .xlsx format with two columns:

  • Corpus: Message content (email or SMS-like)
  • Label: Message category (Phishing, Malware, Scareware, Baiting, Pretexting, or NOT-Malicious)

This dataset supports multi-class classification and is ideal for machine learning applications in cybersecurity, especially in detecting social engineering attacks.

All messages are anonymized and do not contain any personal data.

Contact: jessica.testa@eng.it

Citation: Engineering Ingegneria Inforamtica Spa (2025). Multiclass NLP Dataset for Phishing and Social Engineering Threat Detection [Data set]. Zenodo. DOI:10.5281/zenodo.15235123

Files

Files (51.3 kB)

Name Size Download all
md5:7213a3ee515a713f4eee2a6948f1756e
51.3 kB Download

Additional details

Funding

European Commission
KINAITICS - Cyber-kinetic attacks using Artificial Intelligence 101070176

Dates

Created
2025-04-17