Когортный анализ и сегментация
Когортный анализ и сегментация нужны, чтобы не спутать «продукт стал лучше» с «состав пользователей поменялся». Это самая частая ловушка продуктовых цифр, и собес проверяет, видишь ли ты её.
Стержень: средний тренд обманчив; смотреть надо когортами и внутри сегментов, иначе mix shift и парадокс Симпсона нарисуют что угодно.
// Формулировки: «зачем когортный анализ?», «что такое ретеншн-треугольник?», «как парадокс Симпсона портит выводы?».
Когорта и ретеншн-треугольник
Когорта - группа, объединённая временем общего события: неделя регистрации, месяц первого заказа. Сравнение когорт отделяет улучшение продукта от того, что пользователи просто «постарели».
Когортная таблица (ретеншн-треугольник): строки - когорты, столбцы - их возраст. Читается по двум направлениям: вертикаль (одинаковый возраст у разных когорт) показывает изменения продукта во времени, горизонталь - жизненный цикл одной когорты.
// Поэтому свежие когорты нельзя оценивать по последним столбцам - там ретеншн «ещё не успел упасть». Сравнивают когорты в одинаковом возрасте.
- когорта
- группа с общим временем стартового события
- ретеншн-треугольник
- когорты × возраст: таблица удержания
Mix shift и парадокс Симпсона
Смещение состава (mix shift): метрика выросла не потому, что стало лучше, а потому что поменялся микс трафика - например, притекло больше органики, которая всегда конвертит выше. Лечится сравнением когорт внутри одного сегмента или канала.
Парадокс Симпсона - тот же зверь в острой форме: общий ARPU (average revenue per user) растёт, а внутри каждого сегмента падает, потому что микс сместился к дорогому сегменту. Вывод делают на уровне сегментов, а не агрегата.
// Практическое правило: увидел движение агрегата - первым делом разбей по ключевым срезам. Если внутри срезов картина другая, чем в целом, верь срезам.
- mix shift
- изменение состава трафика, маскирующееся под тренд
- парадокс Симпсона
- агрегат и сегменты показывают противоположное
Сегментация: по действию, не по анкете
Сегментировать полезнее по поведению, чем по демографии: частые против разовых, мобайл против веба двигаются продуктом, а пол и возраст - нет. RFM (recency, frequency, monetary) - быстрая поведенческая сегментация без всякого ML, квантованием по трём осям.
Кластеризацию (k-means и подобное) берут, когда руками сегменты не видны: но фичи надо стандартизировать, а результат - проверить на стабильность и интерпретируемость.
// Критерий здравого смысла: сегментов столько, сколько различающихся действий. Если для двух «сегментов» вы делаете одно и то же это один сегмент, а не два. Кластер без названия и действия бесполезен.
- RFM
- сегментация по давности, частоте, деньгам - без ML
- поведенческий сегмент
- группа по действиям в продукте, не по анкете
Как отвечать: «Зачем когортный анализ - что он даёт поверх среднего?»
Средняя по всем пользователям смешивает тех, кто с продуктом давно, и новичков, поэтому по ней нельзя понять, продукт стал лучше или просто состав аудитории сдвинулся. Когорты это развязывают: я группирую людей по времени старта и сравниваю их в одинаковом возрасте. Тогда вертикаль ретеншн-треугольника честно показывает, влияют ли мои релизы на удержание, а горизонталь - как живёт одна когорта. Это же защищает от mix shift и парадокса Симпсона: агрегатная метрика может расти, пока внутри каждого сегмента она падает, просто микс сместился к дорогому сегменту. Поэтому любое движение агрегата я первым делом разбиваю на когорты и сегменты и делаю вывод на их уровне, а не на уровне общей цифры.
Почему это сильный ответ: назван корень (среднее смешивает возраст и состав), объяснено чтение треугольника и связка с mix shift / Симпсоном - именно то, ради чего когорты и нужны.
На чём валят
- −Сравнить «юзеров января» с «юзерами июня» без учёта возраста когорты.
- −Тренд метрики без разбивки по каналам - mix shift притворяется ростом продукта.
- −Сегментация ради сегментации: 15 кластеров, к которым нет 15 разных действий.
- −k-means без стандартизации фичей - кластеры по самой крупной шкале.
- −Смотреть только свежие когорты, где ретеншн «ещё не успел упасть».
Проверьте себя
Пять вопросов из банка по этой подтеме. Всего их 15, остальные разбираются в тренажёре.
- Общий retention падает, хотя внутри каждой когорты он растёт. Что это?A)Это явная и грубая ошибка в расчётах: подобного встречается редко на реальных данныхB)Продукт объективно стал хуже для каждого отдельного пользователя разомC)Mix shift (парадокс Симпсона): выросла доля слабых когорт в общем миксеD)Это нормальная сезонность, которая сама выправится через пару недель
показать ответ и разбор
+C)Mix shift (парадокс Симпсона): выросла доля слабых когорт в общем миксе// разбор: Классический парадокс Симпсона: если резко вырос приток низкокачественного трафика (слабая когорта), его вес в средневзвешенном тянет общую метрику вниз, хотя каждая когорта по отдельности улучшается. Лечится взвешиванием по когортам или фиксацией состава притока при сравнении.
- Зачем сегментировать метрику по источникам привлечения, а не смотреть только среднее?A)Обычного среднего по всему продукту достаточно, сегментация лишь усложняет отчётB)Сегментация нужна для красоты дашборда перед руководством компанииC)Источники не влияют на поведение — сегментация ничего нового не покажетD)Каналы дают разное качество юзеров; среднее прячет убыточный источник
показать ответ и разбор
+D)Каналы дают разное качество юзеров; среднее прячет убыточный источник// разбор: Пользователи из разных каналов сильно различаются по retention и LTV: органика обычно качественнее платного трафика. Среднее по продукту прячет, что один дорогой канал тихо съедает бюджет с отрицательной юнит-экономикой. Сегментация по источнику — основа решений о перераспределении маркетинг-денег.
- Как ошибка выжившего (survivorship bias) искажает анализ «активных» пользователей?A)Глядя лишь на оставшихся, теряешь ушедших — выводы систематически смещеныB)Ошибка выжившего редко встречается в продуктовой аналитике данныхC)Она проявляется в задачах компьютерного зренияD)Активные пользователи репрезентативны для всей базы
показать ответ и разбор
+A)Глядя лишь на оставшихся, теряешь ушедших — выводы систематически смещены// разбор: Анализируя только оставшихся активных, легко сделать смещённый вывод: «активные обожают фичу X» может означать лишь, что все, кому X не зашла, уже ушли и не попали в выборку. Правильно смотреть когортно, удерживая в поле зрения и отвалившихся, — иначе оптимизируешь продукт под тех, кто и так остался.
- Что такое RFM-сегментация клиентов?A)Деление по давности (Recency), частоте (Frequency) и сумме покупок (Monetary)B)Случайное разбиение клиентов на три равные по размеру группы для тестаC)Сортировка клиентов строго по алфавиту их имён и фамилийD)Сегментация всех пользователей по конкретному типу и модели их мобильного устройства
показать ответ и разбор
+A)Деление по давности (Recency), частоте (Frequency) и сумме покупок (Monetary)// разбор: RFM ранжирует клиентов по трём осям: давность последней покупки (Recency), частота (Frequency) и суммарные траты (Monetary). Простая, но мощная модель для таргетинга: «недавние частые крупные» — VIP, «давно не покупали, но раньше активные» — кандидаты на реактивацию. Помогает решить, кому и что слать.
- Как устроена когортная таблица удержания (retention triangle)?A)Каждая её ячейка показывает суммарную выручку всего продукта за один деньB)Строки в ней — это отдельные пользователи, а столбцы — их персональные анкетные данные профиляC)Это по сути случайная матрица чисел без какой-либо внутренней временной структуры вообщеD)Строки — когорты по дате старта, столбцы — возраст; в ячейке retention этого возраста
показать ответ и разбор
+D)Строки — когорты по дате старта, столбцы — возраст; в ячейке retention этого возраста// разбор: В retention-треугольнике строка — когорта (пришедшие в неделю/месяц), столбец — возраст когорты (0, 1, 2… периода с момента старта), в ячейке — доля активных этого возраста. Вдоль строки видно, как стареет одна когорта; вдоль столбца сравнивают когорты на одинаковом возрасте; по диагонали — календарное время. «Треугольник» — потому что свежие когорты ещё не дожили до старших возрастов.
дальше
Теорию прочитали. Навык ставится повторением
В Сеньорчике эта подтема идёт в ежедневных сессиях: движок возвращает её, пока ответы не станут уверенными, и ведёт прогресс отдельно по каждой подтеме. Теория внутри тоже бесплатна, лимит только на количество вопросов в день.