Multiclass NLP Dataset for Phishing and Social Engineering Threat Detection
Authors/Creators
Description
This dataset contains 624 English-language messages for training and evaluating phishing detection models using Natural Language Processing (NLP). Each message is labeled with one of six classes related to cybersecurity threats or benign content.
The file is in .xlsx format with two columns:
- Corpus: Message content (email or SMS-like)
- Label: Message category (
Phishing,Malware,Scareware,Baiting,Pretexting, orNOT-Malicious)
This dataset supports multi-class classification and is ideal for machine learning applications in cybersecurity, especially in detecting social engineering attacks.
All messages are anonymized and do not contain any personal data.
Contact: jessica.testa@eng.it
Citation: Engineering Ingegneria Inforamtica Spa (2025). Multiclass NLP Dataset for Phishing and Social Engineering Threat Detection [Data set]. Zenodo. DOI:10.5281/zenodo.15235123
Files
Files
(51.3 kB)
| Name | Size | Download all |
|---|---|---|
|
md5:7213a3ee515a713f4eee2a6948f1756e
|
51.3 kB | Download |
Additional details
Funding
Dates
- Created
-
2025-04-17