NONLINEAR DIMENSIONALITY REDUCTION FOR LOOKALIKE AUDIENCE DETECTION USING MANIFOLD LEARNING AND AUTOENCODER-BASED REPRESENTATIONS

Автор(и)

DOI:

https://doi.org/10.26577/jpcsit4120268

Ключові слова:

dimensionality reduction, manifold learning, t-distributed stochastic neighbor embedding (t-SNE), autoencoder, representation learning, lookalike audience modeling, tabular data

Анотація

Аннотация. Ұқсас мінез-құлық сипаттамаларына ие пайдаланушыларды анықтау қазіргі заманғы мақсатты жарнама және клиенттік аналитика жүйелерінде маңызды міндеттердің бірі болып табылады. Пайдаланушы әрекеттерін сипаттайтын жоғары өлшемді кестелік деректер жиынтықтары көбіне күрделі сызықтық емес байланыстарды қамтиды, оларды дәстүрлі сызықтық өлшемділікті азайту әдістері тиімді түрде бейнелей алмайды.

Бұл зерттеу ауқымды телекоммуникациялық деректер негізінде ұқсас аудиторияларды (look-alike audience) анықтауға арналған масштабталатын жүйелерді құру үшін репрезентацияларды үйрену (representation learning) тәсілдерін қарастырады. Алдымен жоғары өлшемді деректер құрылымын зерттеуге арналған бастапқы әдістер ретінде өлшемділікті азайтудың классикалық тәсілдері — Негізгі компоненттер әдісі (Principal Component Analysis, PCA) және t-таратылған стохастикалық көршілерді ендіру (t-distributed Stochastic Neighbor Embedding, t-SNE) талданады. PCA жалпы дисперсияны сақтай отырып, сызықтық проекцияларды орындайды, ал t-SNE сызықтық емес ендіру арқылы жергілікті көршілік құрылымдарын анықтауға мүмкіндік береді. Алайда бұл әдістер негізінен визуализация мен деректерді зерттеу мақсаттарына арналған және жаңа деректер үлгілері үшін масштабталатын параметрлік бейнелеулерді қамтамасыз етпейді.

Осы шектеулерді еңсеру мақсатында пайдаланушылардың ықшам латентті бейнелеулерін қалыптастыруға арналған автоэнкодерлерге негізделген репрезентацияларды үйрену шеңбері ұсынылады. Модель мінез-құлықтық, демографиялық, құрылғыға қатысты және қызметтерді пайдалану атрибуттарын қамтитын анонимдендірілген ауқымды телекоммуникациялық деректер жиынтығында оқытылады. Әртүрлі сипаттамалық нысандар үшін ендірулер (embeddings) үйреніліп, гетерогенді мінез-құлық ақпаратын біріктіретін бірыңғай пайдаланушы репрезентациясына біріктіріледі. Пайдаланушылар арасындағы ұқсастық латентті кеңістікте косинустық ұқсастық (cosine similarity) арқылы есептеледі, бұл ұқсас аудиторияларды тиімді анықтауға мүмкіндік береді.

Ұсынылған жүйе кластерлеу метрикалары және сыртқы мақсатты айнымалыларды қолданатын бірнеше тәуелсіз валидация тапсырмалары арқылы бағаланып, нәтижелердің бейтарап бағалануы қамтамасыз етіледі. Эксперименттік нәтижелер автоэнкодерлер негізіндегі ендірулер латентті кеңістіктің құрылымын жақсартып, классикалық өлшемділікті азайту әдістерімен салыстырғанда ұқсастыққа негізделген іздеуді де, кейінгі жіктеу міндеттерінің өнімділігін де арттыратынын көрсетеді. Зерттеу нәтижелері нақты әлемдегі ұсыным жүйелері мен мақсатты жарнама платформаларында жоғары өлшемді кестелік деректерді өңдеу үшін терең репрезентацияларды үйрену тәсілдерінің тиімділігін дәлелдейді.

Завантажити

Дані для завантаження поки недоступні.

Біографії авторів

  • автор Il’murat Tokhtakhunov, афіліація International Information Technology University, Almaty, Kazakhstan

    Il’murat Tokhtakhunov is a PhD candidate at the Department of Mathematical and Computer Modelling, International Information Technology University (34/1 Manas Street, Almaty, 05000, Kazakhstan) and a Senior Lecturer at the School of Digital Technologies, Narxoz University (Almaty, Kazakhstan). His research focuses on machine learning methods for high-dimensional tabular data analysis, representation learning, dimensionality reduction, and lookalike audience modeling for targeted advertising systems.

  • автор Marat Nurtas, афіліація International Information Technology University, Almaty, Kazakhstan

    Marat Nurtas is an Associate Professor at the Department of Mathematical and Computer Modelling, International Information Technology University (34/1 Manas Street, Almaty, 05000, Kazakhstan) and a Leading Researcher at the Institute of Ionosphere. He received his PhD degree in Mathematical and Computer Modelling from Kazakh-British Technical University and holds a bachelor’s degree in Mathematics from al-Farabi Kazakh National University. His research interests include scientific machine learning, deep neural networks, physics-informed neural networks, geophysical data analysis, earthquake prediction models, and machine learning applications in complex dynamical systems. 

Завантаження

Опубліковано

2026-03-26