Multilingual Phishing Email Dataset for Low-Resource Languages

Published: 24 August 2026| Version 1 | DOI: 10.17632/btjg6kjj5h.1
Contributors:
,
,

Description

Dataset collected from 11 users across diverse regions and fields, featuring varied email topics. Includes a cleaned English anchor dataset, extended to Norwegian and Arabic via controlled translation. Supports benchmarking of ML models, transformers, multilingual encoders, and large language models in direct and translation-based evaluation.

Files

Institutions

Categories

Machine Learning, Low-Resource LLM

Licence