Анализ предпочтений пользователей мессенджеров: от опросных данных к интерактивному дашборду в ВКР
В марте 2026 года портал «Дром» провёл опрос среди автолюбителей: «Какими приложениями на телефоне вы пользуетесь для переписки?». Результаты — традиционные лидеры (WhatsApp, Telegram, Viber) и неожиданный рост нишевых мессенджеров — стали готовым кейсом для дипломного проекта. Вы можете не просто процитировать эту статистику, а превратить её в полноценное исследование: собрать сырые данные, очистить, проанализировать и визуализировать. Такая работа покажет комиссии, что вы владеете полным циклом Data Engineering — от ETL до построения дашбордов. А главное — тема ложится в реальный бизнес-контекст: понимание каналов коммуникации с клиентами критически важно для любого сервиса.
1. Как встроить опрос «Дрома» в структуру ВКР
Ваша работа может называться, например: «Разработка информационно-аналитической системы для исследования предпочтений пользователей мессенджеров (на примере автолюбителей)». Ниже — три варианта тем, каждая из которых опирается на данные статьи.
Тема 1. Анализ и визуализация рыночных долей мессенджеров
- Цель: Построить интерактивный дашборд с динамикой долей мессенджеров среди автолюбителей.
- Задачи: 1) Сбор и верификация открытых данных опроса; 2) Очистка и агрегация (Pandas); 3) Визуализация (Plotly / Power BI); 4) Оценка погрешности выборки.
- Структура: Глава 1 – обзор методов анализа опросов (ISO 20252, ГОСТ 7.32-2017). Глава 2 – проектирование конвейера данных (ETL, Jupyter Notebook). Глава 3 – результаты и интерпретация (диаграммы, доверительные интервалы).
Тема 2. Кластеризация пользователей по частоте использования мессенджеров
- Цель: Выявить сегменты автолюбителей с разными паттернами общения (Telegram-ориентированные, WhatsApp-консерваторы, мультиплатформенные).
- Задачи: 1) Подготовка признакового пространства; 2) Применение K-Means / DBSCAN; 3) Интерпретация кластеров; 4) Рекомендации для маркетинга.
- Структура: Глава 1 – методы машинного обучения в маркетинговых исследованиях. Глава 2 – реализация пайплайна (scikit-learn, Feature Engineering). Глава 3 – профили кластеров и средняя доля использования.
Тема 3. Прогнозирование популярности мессенджеров на основе временных рядов
- Цель: Построить модель ARIMA/LSTM для предсказания доли мессенджеров на 6 месяцев.
- Задачи: 1) Сбор исторических данных (за 2020–2026 гг.) из открытых источников; 2) Декомпозиция ряда; 3) Обучение и валидация модели; 4) Оценка точности (MAPE, RMSE).
- Структура: Глава 1 – теория временных рядов. Глава 2 – разработка модели (Python, statsmodels). Глава 3 – эксперимент и сравнение с реальными данными статьи.
2. Конкретные приёмы для первой и второй глав
В Главе 1 (аналитической) вы описываете предметную область. Как сослаться на статью? Не просто «автолюбители чаще используют Telegram». Сделайте так:
- Приведите контекст: «Согласно опросу "Дром" (март 2026, выборка 10 000 респондентов), 73% респондентов указали Telegram как основной мессенджер. Методология опроса — анкетирование через мобильное приложение.» Это сразу показывает, что вы понимаете источники данных.
- Добавьте критический анализ: «Результаты могут быть смещены из-за самоотбора — опрашивались только пользователи приложения "Дром".» — так вы демонстрируете навыки инженера данных.
В Главе 2 (проектной) вы реализуете ETL-процесс. Пример кода обработки гипотетического CSV с результатами опроса:
import pandas as pd
import numpy as np
# Загрузка сырых данных
df = pd.read_csv('messenger_survey.csv')
# Удаление дубликатов
df.drop_duplicates(subset='user_id', inplace=True)
# Преобразование колонки "messenger" в one-hot encoding
dummies = pd.get_dummies(df['messenger'], prefix='messenger')
df = pd.concat([df, dummies], axis=1)
# Расчет доли каждого мессенджера
shares = df.filter(like='messenger_').mean().sort_values(ascending=False)
print(shares)
Такой блок кода — отличный аргумент на защите: «я не просто прочитал статью, а обработал сырые данные».
3. Метрики и визуализация: что оценивать
Комиссия ждёт цифры. Вот три метрики из поддомена Data Engineering:
- Доля рынка (Market Share) — процент респондентов, назвавших мессенджер основным. Можно построить круговую диаграмму (Pie Chart) или столбчатую (Bar Chart).
- Доверительный интервал (95% CI) — показывает точность оценки. Формула: ± z * sqrt(p*(1-p)/n). Вставьте расчёт в Python.
- Индекс лояльности (NPS-like) — если в опросе были вопросы «порекомендуете ли друзьям?». Но в статье нет — можно смоделировать.
Для визуализации используйте Plotly (интерактивные графики) или Power BI Desktop (экспорт PDF для диплома). Пример диаграммы в стиле matplotlib:
import matplotlib.pyplot as plt
messengers = ['Telegram', 'WhatsApp', 'Viber', 'Другие']
shares = [45, 35, 15, 5]
plt.figure(figsize=(8,5))
plt.bar(messengers, shares, color=['#0088cc', '#25D366', '#7B519D', '#999'])
plt.title('Распределение предпочтений мессенджеров среди автолюбителей (опрос Дром, 2026)')
plt.ylabel('% респондентов')
plt.grid(axis='y', alpha=0.3)
plt.show()
Чему вы научитесь, реализовав этот кейс
- Проектировать ETL-конвейер для данных опросов (от CSV до дашборда).
- Применять статистические методы (доверительные интервалы, проверка гипотез).
- Строить интерактивные визуализации в Plotly/Power BI.
- Оформлять отчёт по ГОСТ 7.32-2017 (таблицы, ссылки, приложения).
- Аргументированно отвечать на вопросы комиссии про репрезентативность выборки.
Часто задаваемые вопросы (FAQ)
Как оформить код в ВКР, чтобы не было претензий от нормоконтроля?
Выносите ключевые фрагменты в приложения (например, Приложение А – Листинг модуля очистки данных), а в тексте давайте только пояснения и маленькие примеры. Шрифт моноширинный (Courier New, 10pt). Обязательно укажите версию Python и библиотек.
Нужно ли в работе описывать методологию оригинального опроса «Дрома»?
Да, это повышает научность. Напишите: «Использованы вторичные данные, собранные методом онлайн-анкетирования (N=…). Ограничения: смещение в сторону активных пользователей платформы.» Комиссия оценит критический подход.
Какие метрики качества модели обязательны для темы прогнозирования?
Как минимум RMSE (среднеквадратичная ошибка) и MAPE (средняя абсолютная процентная ошибка). Для ARIMA дополнительно AIC/BIC. Все метрики сравните с baseline (наивный прогноз).
Где взять открытые данные, если «Дром» не публикует сырые CSV?
Можно смоделировать выборку: сгенерировать синтетические данные на основе опубликованных процентов (функция numpy.random.choice). Укажите в работе, что данные синтезированы для демонстрации методики. Это допустимо, если вы честно опишете допущения.
✅ Чек-лист «Что проверить перед сдачей»
- Ссылки на источник: в списке литературы есть статья cnews.ru (дата, автор, URL).
- Соответствие задач выводам: каждая задача из введения раскрыта в главах.
- Метрики: приведены числовые значения (доли, погрешность, RMSE).
- Схемы и диаграммы: подписаны, имеют единый стиль, сохранены в высоком разрешении.
- Уникальность: текст проверен на антиплагиат (оригинальность ≥ 70%).
- ГОСТ: оформление титула, содержания, приложений соответствует требованиям вашего вуза.
- Код в приложении: работает на чистом Python без ошибок импорта.
❌ Типичные ошибки студентов (и как их избежать)
Ошибка 1: «Просто пересказал статью». Комиссия хочет видеть аналитику. Не пишите «Telegram популярен». Лучше: «По данным опроса, доля Telegram составила 45% (95% ДИ: 42–48%). Это на 10% больше, чем в аналогичном опросе 2024 года». Сделайте сравнительный анализ.
Ошибка 2: «Нетопис методологии сбора данных». Даже если вы используете готовые данные, опишите процедуру: канал сбора, размер выборки, возможные ошибки смещения. Это покажет глубину проработки.
Ошибка 3: «Диаграммы без подписей осей и единиц измерения». В дипломе каждая иллюстрация должна быть понятна без чтения текста. Подписывайте оси, добавляйте легенду, указывайте источник данных внизу рисунка.
Нужна помощь с реализацией этого кейса? Наши эксперты могут проконсультировать по выбору стека, оформлению расчётно-пояснительной записки и подготовке защитной речи. Первая консультация — бесплатно. Если вы ограничены по времени (120 часов на ВКР — стандартная трудоёмкость), мы поможем с любой темой, от анализа данных до разработки веб-сервиса. Заявку можно оставить на сайте.
Источник: Стало известно, какими мессенджерами чаще пользуются автолюбители страны (опубликовано 2026-03-16)
Использованные стандарты: ГОСТ 7.32-2017 (отчёт о НИР), ISO 20252 (рыночные исследования), методология CRISP-DM для Data Mining.