NONLINEAR DIMENSIONALITY REDUCTION FOR LOOKALIKE AUDIENCE DETECTION USING MANIFOLD LEARNING AND AUTOENCODER-BASED REPRESENTATIONS

Авторы

DOI:

https://doi.org/10.26577/jpcsit4120268

Ключевые слова:

dimensionality reduction, manifold learning, t-distributed stochastic neighbor embedding (t-SNE), autoencoder, representation learning, lookalike audience modeling, tabular data

Аннотация

Аннотация. Выявление пользователей со схожими поведенческими характеристиками является важной задачей в современных системах таргетированной рекламы и клиентской аналитики. Высокоразмерные табличные наборы данных, описывающие активность пользователей, часто содержат сложные нелинейные зависимости, которые невозможно эффективно выявить с помощью традиционных линейных методов снижения размерности.

В данном исследовании рассматриваются подходы обучения представлений (representation learning) для построения масштабируемых систем обнаружения похожих аудиторий (look-alike audience) на основе крупномасштабных телекоммуникационных данных. Сначала в качестве базовых методов анализа структуры высокоразмерных данных исследуются классические методы снижения размерности, включая метод главных компонент (Principal Component Analysis, PCA) и t-распределённое стохастическое вложение соседей (t-distributed Stochastic Neighbor Embedding, t-SNE). PCA выполняет линейные проекции, сохраняя глобальную дисперсию данных, тогда как t-SNE выявляет локальные структуры соседства посредством нелинейного вложения. Однако данные методы в основном предназначены для визуализации и исследовательского анализа данных и не обеспечивают масштабируемых параметрических отображений для новых выборок данных.

Для преодоления этих ограничений предлагается фреймворк обучения представлений на основе автоэнкодеров, предназначенный для формирования компактных латентных представлений пользователей. Модель обучается на крупномасштабном анонимизированном телекоммуникационном наборе данных, содержащем поведенческие, демографические, связанные с устройствами и использованием сервисов атрибуты. Вложения (embeddings) обучаются для нескольких групп признаков и объединяются в единое представление пользователя, интегрирующее гетерогенную поведенческую информацию. Сходство пользователей затем вычисляется с использованием косинусного сходства (cosine similarity) в латентном пространстве, что позволяет эффективно идентифицировать похожие аудитории.

Предложенная система оценивается с использованием метрик кластеризации и нескольких независимых задач валидации с внешними целевыми переменными для обеспечения объективной оценки производительности. Экспериментальные результаты показывают, что вложения на основе автоэнкодеров формируют более структурированное латентное пространство и улучшают как поиск на основе сходства, так и эффективность последующих задач классификации по сравнению с классическими методами снижения размерности. Полученные результаты подчеркивают эффективность методов глубокого обучения представлений для работы с высокоразмерными табличными данными в реальных системах рекомендаций и таргетированной рекламы.

Скачивания

Данные по скачиваниям пока не доступны.

Биографии авторов

  • Il’murat Tokhtakhunov, International Information Technology University, Almaty, Kazakhstan

    Il’murat Tokhtakhunov is a PhD candidate at the Department of Mathematical and Computer Modelling, International Information Technology University (34/1 Manas Street, Almaty, 05000, Kazakhstan) and a Senior Lecturer at the School of Digital Technologies, Narxoz University (Almaty, Kazakhstan). His research focuses on machine learning methods for high-dimensional tabular data analysis, representation learning, dimensionality reduction, and lookalike audience modeling for targeted advertising systems.

  • Marat Nurtas, International Information Technology University, Almaty, Kazakhstan

    Marat Nurtas is an Associate Professor at the Department of Mathematical and Computer Modelling, International Information Technology University (34/1 Manas Street, Almaty, 05000, Kazakhstan) and a Leading Researcher at the Institute of Ionosphere. He received his PhD degree in Mathematical and Computer Modelling from Kazakh-British Technical University and holds a bachelor’s degree in Mathematics from al-Farabi Kazakh National University. His research interests include scientific machine learning, deep neural networks, physics-informed neural networks, geophysical data analysis, earthquake prediction models, and machine learning applications in complex dynamical systems. 

Опубликован

2026-03-26

Как цитировать

NONLINEAR DIMENSIONALITY REDUCTION FOR LOOKALIKE AUDIENCE DETECTION USING MANIFOLD LEARNING AND AUTOENCODER-BASED REPRESENTATIONS. (2026). Journal of Problems in Computer Science and Information Technologies, 4(1), 86-99. https://doi.org/10.26577/jpcsit4120268