Аналитика данных: вопросы на собеседовании

Продуктовые метрики, воронки, A/B-тесты и статистика, когортный анализ, SQL и pandas для аналитика.

#1Продуктовые метрикиjunior

Какие продуктовые метрики вы знаете? Что такое DAU, MAU, retention, LTV, CAC?

Активность:

  • DAU / WAU / MAU — уникальные активные пользователи за день, неделю, месяц. Важно договориться, что считается «активностью»: вход, ключевое действие или любое событие.
  • Stickiness = DAU / MAU — как часто месячная аудитория возвращается. 20% считается хорошим показателем для многих продуктов, для мессенджеров — выше 50%.

Удержание:

  • Retention N-го дня — доля пользователей, вернувшихся на N-й день после первого визита. Считается по когортам.
  • Churn — доля ушедших за период; для подписок — доля не продливших подписку.

Деньги:

  • Конверсия — доля пользователей, совершивших целевое действие.
  • ARPU — средняя выручка на пользователя, ARPPU — на платящего.
  • LTV — выручка от пользователя за всё время жизни.
  • CAC — стоимость привлечения одного клиента.
  • LTV / CAC — окупаемость привлечения. Ориентир для здорового бизнеса — больше 3.

North Star Metric — одна метрика, лучше всего отражающая ценность для пользователя: для Spotify — время прослушивания, для маркетплейса — число успешных заказов.

Сильный ответ показывает, что метрики связаны: рост MAU при падающем retention означает, что продукт растёт за счёт маркетинга, а не ценности.

  • Как посчитать LTV для подписочного сервиса?
  • Какую North Star метрику вы бы выбрали для нашего продукта?
#2Экспериментыmiddle

Как спланировать и провести A/B-тест?

1. Гипотеза. «Если сократить форму регистрации с 6 полей до 3, конверсия в регистрацию вырастет, потому что пользователи бросают длинную форму».

2. Метрики. Одна целевая (конверсия в регистрацию), вспомогательные (время заполнения) и контрольные (guardrail) — то, что не должно ухудшиться: доля активировавшихся после регистрации, жалобы.

3. Дизайн:

  • единица рандомизации — обычно пользователь, а не сессия;
  • минимальный детектируемый эффект (MDE) — какой прирост имеет смысл для бизнеса;
  • уровень значимости (обычно α = 0.05) и мощность (обычно 80%);
  • размер выборки и длительность считаются заранее. Длительность — не меньше полной недели, чтобы учесть сезонность по дням.

4. Проверка корректности. A/A-тест на старте, контроль равенства размеров групп — SRM (sample ratio mismatch) говорит о поломке сплитования.

5. Анализ. Статистический критерий под тип метрики: z-тест для пропорций, t-тест для средних, бутстреп для сложных метрик. Проверка на сегментах — осторожно, с поправкой на множественные сравнения.

Главные ошибки:

  • подглядывание — остановка теста, как только p-value стал меньше 0.05. Это резко увеличивает долю ложноположительных результатов;
  • слишком много метрик без поправки;
  • слишком короткий тест, эффект новизны;
  • взаимовлияние групп (сетевые эффекты, общий склад).
  • Что такое MDE и как он связан с размером выборки?
  • Что делать, если тест показал рост одной метрики и падение другой?
#3Статистикаmiddle

Что такое p-value? Что такое ошибки первого и второго рода?

p-value — вероятность получить наблюдаемый результат или ещё более экстремальный, если нулевая гипотеза верна (то есть эффекта нет).

Чем p-value НЕ является — именно это проверяют на собеседовании:

  • не вероятность того, что нулевая гипотеза верна;
  • не вероятность того, что результат случаен;
  • не размер эффекта: при огромной выборке ничтожный и бесполезный эффект даст крошечный p-value.

Если p-value меньше выбранного уровня значимости α (обычно 0.05), нулевую гипотезу отвергаем.

Ошибки:

  • I рода (α, ложноположительная) — нашли эффект, которого нет. Выкатили бесполезное изменение. Вероятность контролируем уровнем значимости.
  • II рода (β, ложноотрицательная) — не нашли эффект, который есть. Упустили хорошее изменение. Мощность = 1 − β — вероятность обнаружить эффект, если он есть; обычно целятся в 80%.
Эффекта нетЭффект есть
Нашли эффектОшибка I родаВерно
Не нашлиВерноОшибка II рода

Компромисс: уменьшая α, мы чаще пропускаем реальные эффекты. Снизить обе ошибки одновременно можно только увеличив выборку или уменьшив дисперсию метрики (например, методом CUPED).

Хорошее дополнение: всегда сообщать доверительный интервал эффекта, а не только p-value.

  • Что такое доверительный интервал?
  • Как снизить дисперсию метрики в A/B-тесте?
#4Статистикаjunior

Когда использовать среднее, а когда медиану? Что делать с выбросами?

Среднее чувствительно к выбросам: один миллиардер в комнате поднимет «средний доход» до миллионов. Медиана — значение, которое делит упорядоченную выборку пополам, — к выбросам устойчива.

Когда что:

  • распределение близко к симметричному (рост, время реакции без хвостов) — среднее и медиана близки, среднее удобнее для дальнейших расчётов;
  • скошенное распределение с длинным хвостом — доходы, чеки, время на сайте, время ответа сервера — медиана или перцентили точнее описывают «типичное» значение;
  • для денег бизнесу нужно среднее: выручка = среднее × число пользователей. Медианный чек не скажет, сколько денег принёс канал.

Выбросы — что делать:

  1. Понять природу: ошибка данных (возраст 250 лет, дублирование событий), бот, тестовый аккаунт — или реальное поведение (крупный оптовый покупатель).
  2. Ошибки и ботов — удалить.
  3. Реальные экстремальные значения — не выбрасывать молча. Можно винзоризировать (заменить значения выше 99-го перцентиля на значение 99-го перцентиля), использовать логарифмирование, робастные статистики, отдельно анализировать сегмент.

Визуализация: гистограмма и ящик с усами (boxplot) — первое, что стоит построить перед расчётом любых средних.

  • Что такое перцентиль?
  • Как выбросы влияют на A/B-тест?
#5Мышление аналитикаjunior

Чем корреляция отличается от причинно-следственной связи? Приведите пример ложного вывода.

Корреляция — статистическая связь: переменные меняются согласованно. Причинность — изменение одной переменной вызывает изменение другой.

Почему корреляция не доказывает причинность:

  1. Скрытая третья переменная. Продажи мороженого и число утоплений коррелируют — обе растут из-за жары.
  2. Обратная причинность. Пользователи, включившие уведомления, удерживаются лучше. Но, возможно, это самые вовлечённые пользователи включают уведомления, а не уведомления делают их вовлечёнными.
  3. Смещение отбора. Выводы только по тем, кто дошёл до конца воронки.
  4. Случайность при множестве проверенных пар.

Продуктовый пример: «Пользователи, которые пользуются функцией X, платят в 3 раза чаще — давайте показывать X всем». Скорее всего, функцией пользуются и так уже мотивированные пользователи. Навязав её всем, мы не получим роста.

Парадокс Симпсона — тренд в каждой группе противоположен тренду в объединённых данных. Классика: лечение A эффективнее B и для лёгких, и для тяжёлых случаев, но в сумме выглядит хуже, потому что его чаще назначали тяжёлым больным.

Как установить причинность: рандомизированный эксперимент (A/B-тест) — золотой стандарт. Если эксперимент невозможен — квазиэкспериментальные методы: difference-in-differences, регрессия на разрыве, синтетический контроль.

  • Что такое difference-in-differences?
  • Как проверить, что фича повлияла на retention, без A/B-теста?

Ещё 7 вопросов в этом треке

  1. Что такое когортный анализ и воронка конверсии? Как найти узкое место?
  2. Напишите SQL-запрос для расчёта retention 7-го дня по недельным когортам.
  3. Какие операции pandas вы используете чаще всего? Как обработать пропуски?
  4. Ключевая метрика упала на 20% за день. Как будете разбираться?
  5. Какой график выбрать для какой задачи? Какие ошибки в визуализации встречаются чаще всего?
  6. Что такое DWH, ETL и ELT? Чем OLTP отличается от OLAP?
  7. Как оценить эффект от новой функции, если A/B-тест провести нельзя?