APPLICATION OF MACHINE LEARNING METHODS FOR PHISHING ATTACK DETECTION: A COMPARATIVE ANALYSIS OF MODELS AND THEIR EFFECTIVENESS

Авторы

DOI:

https://doi.org/10.26577/jpcsit4220267

Ключевые слова:

обнаружение фишинга, машинное обучение, случайный лес, кибербезопасность, ансамблевые методы

Аннотация

Аннотация. Фишинг является одной из наиболее актуальных угроз кибербезопасности, поскольку он может основываться как на технических уязвимостях, так и на человеческом факторе. В данной работе представлены решения на основе машинного обучения (ML) для обнаружения фишинговых веб-адресов (phishing URLs) с использованием набора данных LegitPhish, содержащего 101 219 размеченных записей и 17 инженерных признаков. Были построены и протестированы шесть моделей с применением стандартных метрик оценки, включая логистическую регрессию, метод опорных векторов (SVM), случайный лес, XGBoost, многослойный перцептрон (MLP) и гибридную модель CNN-LSTM.

Результаты показывают, что ансамблевые методы превосходят как классические, так и методы глубокого обучения при работе со структурированными табличными данными. В частности, модель случайного леса продемонстрировала наилучшие показатели по F1-мере и ROC-AUC, достигнув значений 0,952 и 0,992 соответственно, что свидетельствует о хорошем балансе между точностью (92,8) и полнотой (97,8). Также было установлено, что модели XGBoost и MLP показывают высокие результаты, тогда как модель CNN-LSTM, несмотря на более высокую сложность, не дала существенного прироста качества.

Полученные результаты указывают на то, что оптимизированные ансамблевые модели являются эффективным и мощным инструментом для обнаружения фишинга. Кроме того, предложенный подход может быть применён и в других областях кибербезопасности, включая выявление аномалий в сетях 5G/6G.

Скачивания

Данные по скачиваниям пока не доступны.

Биографии авторов

  • Marat Nurtas, Al-Farabi Kazakh National University, Almaty, Kazakhstan

    Aerna Aheti is a master's student at the Department of Artificial Intelligence and Big Data, Al-Farabi Kazakh National University, Almaty, Kazakhstan. Her research focuses on ensemble machine learning methods for cybersecurity applications, with particular emphasis on phishing URL detection and comparative model evaluation. She has extensive experience in data diagnostics, feature selection, and leakage prevention in cybersecurity ML pipelines. Her current work involves optimizing Random Forest and XGBoost classifiers for real-time threat detection systems.

  • Hadi Mukhtar, Al-Farabi Kazakh National University, Almaty, Kazakhstan

    Hadi Mukhtar is a master's student at the Department of Artificial Intelligence and Big Data, Al-Farabi Kazakh National University, Almaty, Kazakhstan. His research focuses on deep learning architectures for security-related classification tasks, including CNN-LSTM hybrid models for phishing detection and network anomaly identification. He specializes in hyperparameter optimization, model regularization techniques, and cross-dataset generalization assessment for deep neural networks in cybersecurity contexts.

Опубликован

2026-06-19

Как цитировать

APPLICATION OF MACHINE LEARNING METHODS FOR PHISHING ATTACK DETECTION: A COMPARATIVE ANALYSIS OF MODELS AND THEIR EFFECTIVENESS. (2026). Journal of Problems in Computer Science and Information Technologies, 4(2), 63-73. https://doi.org/10.26577/jpcsit4220267