NONLINEAR DIMENSIONALITY REDUCTION FOR LOOKALIKE AUDIENCE DETECTION USING MANIFOLD LEARNING AND AUTOENCODER-BASED REPRESENTATIONS
DOI:
https://doi.org/10.26577/jpcsit4120268Ключевые слова:
dimensionality reduction, manifold learning, t-distributed stochastic neighbor embedding (t-SNE), autoencoder, representation learning, lookalike audience modeling, tabular dataАннотация
Аннотация. Выявление пользователей со схожими поведенческими характеристиками является важной задачей в современных системах таргетированной рекламы и клиентской аналитики. Высокоразмерные табличные наборы данных, описывающие активность пользователей, часто содержат сложные нелинейные зависимости, которые невозможно эффективно выявить с помощью традиционных линейных методов снижения размерности.
В данном исследовании рассматриваются подходы обучения представлений (representation learning) для построения масштабируемых систем обнаружения похожих аудиторий (look-alike audience) на основе крупномасштабных телекоммуникационных данных. Сначала в качестве базовых методов анализа структуры высокоразмерных данных исследуются классические методы снижения размерности, включая метод главных компонент (Principal Component Analysis, PCA) и t-распределённое стохастическое вложение соседей (t-distributed Stochastic Neighbor Embedding, t-SNE). PCA выполняет линейные проекции, сохраняя глобальную дисперсию данных, тогда как t-SNE выявляет локальные структуры соседства посредством нелинейного вложения. Однако данные методы в основном предназначены для визуализации и исследовательского анализа данных и не обеспечивают масштабируемых параметрических отображений для новых выборок данных.
Для преодоления этих ограничений предлагается фреймворк обучения представлений на основе автоэнкодеров, предназначенный для формирования компактных латентных представлений пользователей. Модель обучается на крупномасштабном анонимизированном телекоммуникационном наборе данных, содержащем поведенческие, демографические, связанные с устройствами и использованием сервисов атрибуты. Вложения (embeddings) обучаются для нескольких групп признаков и объединяются в единое представление пользователя, интегрирующее гетерогенную поведенческую информацию. Сходство пользователей затем вычисляется с использованием косинусного сходства (cosine similarity) в латентном пространстве, что позволяет эффективно идентифицировать похожие аудитории.
Предложенная система оценивается с использованием метрик кластеризации и нескольких независимых задач валидации с внешними целевыми переменными для обеспечения объективной оценки производительности. Экспериментальные результаты показывают, что вложения на основе автоэнкодеров формируют более структурированное латентное пространство и улучшают как поиск на основе сходства, так и эффективность последующих задач классификации по сравнению с классическими методами снижения размерности. Полученные результаты подчеркивают эффективность методов глубокого обучения представлений для работы с высокоразмерными табличными данными в реальных системах рекомендаций и таргетированной рекламы.





