APPLICATION OF MACHINE LEARNING METHODS FOR PHISHING ATTACK DETECTION: A COMPARATIVE ANALYSIS OF MODELS AND THEIR EFFECTIVENESS
DOI:
https://doi.org/10.26577/jpcsit4220267Ключевые слова:
обнаружение фишинга, машинное обучение, случайный лес, кибербезопасность, ансамблевые методыАннотация
Аннотация. Фишинг является одной из наиболее актуальных угроз кибербезопасности, поскольку он может основываться как на технических уязвимостях, так и на человеческом факторе. В данной работе представлены решения на основе машинного обучения (ML) для обнаружения фишинговых веб-адресов (phishing URLs) с использованием набора данных LegitPhish, содержащего 101 219 размеченных записей и 17 инженерных признаков. Были построены и протестированы шесть моделей с применением стандартных метрик оценки, включая логистическую регрессию, метод опорных векторов (SVM), случайный лес, XGBoost, многослойный перцептрон (MLP) и гибридную модель CNN-LSTM.
Результаты показывают, что ансамблевые методы превосходят как классические, так и методы глубокого обучения при работе со структурированными табличными данными. В частности, модель случайного леса продемонстрировала наилучшие показатели по F1-мере и ROC-AUC, достигнув значений 0,952 и 0,992 соответственно, что свидетельствует о хорошем балансе между точностью (92,8) и полнотой (97,8). Также было установлено, что модели XGBoost и MLP показывают высокие результаты, тогда как модель CNN-LSTM, несмотря на более высокую сложность, не дала существенного прироста качества.
Полученные результаты указывают на то, что оптимизированные ансамблевые модели являются эффективным и мощным инструментом для обнаружения фишинга. Кроме того, предложенный подход может быть применён и в других областях кибербезопасности, включая выявление аномалий в сетях 5G/6G.





