NONLINEAR DIMENSIONALITY REDUCTION FOR LOOKALIKE AUDIENCE DETECTION USING MANIFOLD LEARNING AND AUTOENCODER-BASED REPRESENTATIONS
DOI:
https://doi.org/10.26577/jpcsit4120268Ключові слова:
dimensionality reduction, manifold learning, t-distributed stochastic neighbor embedding (t-SNE), autoencoder, representation learning, lookalike audience modeling, tabular dataАнотація
Аннотация. Ұқсас мінез-құлық сипаттамаларына ие пайдаланушыларды анықтау қазіргі заманғы мақсатты жарнама және клиенттік аналитика жүйелерінде маңызды міндеттердің бірі болып табылады. Пайдаланушы әрекеттерін сипаттайтын жоғары өлшемді кестелік деректер жиынтықтары көбіне күрделі сызықтық емес байланыстарды қамтиды, оларды дәстүрлі сызықтық өлшемділікті азайту әдістері тиімді түрде бейнелей алмайды.
Бұл зерттеу ауқымды телекоммуникациялық деректер негізінде ұқсас аудиторияларды (look-alike audience) анықтауға арналған масштабталатын жүйелерді құру үшін репрезентацияларды үйрену (representation learning) тәсілдерін қарастырады. Алдымен жоғары өлшемді деректер құрылымын зерттеуге арналған бастапқы әдістер ретінде өлшемділікті азайтудың классикалық тәсілдері — Негізгі компоненттер әдісі (Principal Component Analysis, PCA) және t-таратылған стохастикалық көршілерді ендіру (t-distributed Stochastic Neighbor Embedding, t-SNE) талданады. PCA жалпы дисперсияны сақтай отырып, сызықтық проекцияларды орындайды, ал t-SNE сызықтық емес ендіру арқылы жергілікті көршілік құрылымдарын анықтауға мүмкіндік береді. Алайда бұл әдістер негізінен визуализация мен деректерді зерттеу мақсаттарына арналған және жаңа деректер үлгілері үшін масштабталатын параметрлік бейнелеулерді қамтамасыз етпейді.
Осы шектеулерді еңсеру мақсатында пайдаланушылардың ықшам латентті бейнелеулерін қалыптастыруға арналған автоэнкодерлерге негізделген репрезентацияларды үйрену шеңбері ұсынылады. Модель мінез-құлықтық, демографиялық, құрылғыға қатысты және қызметтерді пайдалану атрибуттарын қамтитын анонимдендірілген ауқымды телекоммуникациялық деректер жиынтығында оқытылады. Әртүрлі сипаттамалық нысандар үшін ендірулер (embeddings) үйреніліп, гетерогенді мінез-құлық ақпаратын біріктіретін бірыңғай пайдаланушы репрезентациясына біріктіріледі. Пайдаланушылар арасындағы ұқсастық латентті кеңістікте косинустық ұқсастық (cosine similarity) арқылы есептеледі, бұл ұқсас аудиторияларды тиімді анықтауға мүмкіндік береді.
Ұсынылған жүйе кластерлеу метрикалары және сыртқы мақсатты айнымалыларды қолданатын бірнеше тәуелсіз валидация тапсырмалары арқылы бағаланып, нәтижелердің бейтарап бағалануы қамтамасыз етіледі. Эксперименттік нәтижелер автоэнкодерлер негізіндегі ендірулер латентті кеңістіктің құрылымын жақсартып, классикалық өлшемділікті азайту әдістерімен салыстырғанда ұқсастыққа негізделген іздеуді де, кейінгі жіктеу міндеттерінің өнімділігін де арттыратынын көрсетеді. Зерттеу нәтижелері нақты әлемдегі ұсыным жүйелері мен мақсатты жарнама платформаларында жоғары өлшемді кестелік деректерді өңдеу үшін терең репрезентацияларды үйрену тәсілдерінің тиімділігін дәлелдейді.





