APPLICATION OF MACHINE LEARNING METHODS FOR PHISHING ATTACK DETECTION: A COMPARATIVE ANALYSIS OF MODELS AND THEIR EFFECTIVENESS

Автор(и)

DOI:

https://doi.org/10.26577/jpcsit4220267

Ключові слова:

фишингті анықтау, машиналық оқыту, кездейсоқ ормандар, киберқауіпсіздік, ансамбльдік әдістер

Анотація

Аңдатпа. Фишинг — киберқауіпсіздік саласындағы өзекті қауіптердің бірі, себебі ол техникалық осалдықтарға да, адам факторына да негізделуі мүмкін. Бұл мақалада LegitPhish деректер жиынын пайдалана отырып (101 219 таңбаланған жазба және 17 инженерлік белгі), фишингтік веб-мекенжайларды (phishing URL) анықтауға арналған машиналық оқыту (ML) әдістері ұсынылады. Зерттеу барысында алты модель құрастырылып, кеңінен қолданылатын бағалау метрикалары арқылы тексерілді: логистикалық регрессия, тірек векторлар әдісі (SVM), кездейсоқ орман (Random Forest), XGBoost, көпқабатты перцептрон (MLP) және CNN-LSTM гибридті моделі.

Нәтижелер көрсеткендей, ансамбльдік тәсілдер құрылымдалған кестелік деректермен жұмыс істеуде классикалық және терең оқыту әдістерінен тиімдірек. Атап айтқанда, Random Forest моделі F1-мера және ROC-AUC көрсеткіштері бойынша ең жоғары нәтижеге жетіп, тиісінше 0,952 және 0,992 мәндерін көрсетті, бұл дәлдік (92,8) пен толықтық (97,8) арасындағы тиімді тепе-теңдікті білдіреді. Сонымен қатар, XGBoost және MLP модельдері де жақсы нәтижелер көрсетті, ал CNN-LSTM моделі күрделілігі жоғары болғанына қарамастан, қосымша тиімділік бермеді.

Зерттеу нәтижелері оңтайландырылған ансамбльдік модельдердің фишингті анықтауда қуатты әрі тиімді құрал екенін дәлелдейді. Сонымен қатар, ұсынылған тәсілді киберқауіпсіздіктің басқа салаларында, соның ішінде 5G/6G желілеріндегі аномалияларды анықтауда қолдануға болады.

Завантажити

Дані для завантаження поки недоступні.

Біографії авторів

  • автор Aerna Aheti, афіліація Al-Farabi Kazakh National University, Almaty, Kazakhstan

    Aerna Aheti is a master's student at the Department of Artificial Intelligence and Big Data, Al-Farabi Kazakh National University, Almaty, Kazakhstan. Her research focuses on ensemble machine learning methods for cybersecurity applications, with particular emphasis on phishing URL detection and comparative model evaluation. She has extensive experience in data diagnostics, feature selection, and leakage prevention in cybersecurity ML pipelines. Her current work involves optimizing Random Forest and XGBoost classifiers for real-time threat detection systems.

  • автор Hadi Mukhtar, афіліація Al-Farabi Kazakh National University, Almaty, Kazakhstan

    Hadi Mukhtar is a master's student at the Department of Artificial Intelligence and Big Data, Al-Farabi Kazakh National University, Almaty, Kazakhstan. His research focuses on deep learning architectures for security-related classification tasks, including CNN-LSTM hybrid models for phishing detection and network anomaly identification. He specializes in hyperparameter optimization, model regularization techniques, and cross-dataset generalization assessment for deep neural networks in cybersecurity contexts.

Завантаження

Опубліковано

2026-06-19