сеньорчикОткрыть в Telegram
← вся теориятеория к собесу · Продуктовая аналитика

Когортный анализ и сегментация

Когорты и сегменты: продукт или состав?

Когортный анализ и сегментация нужны, чтобы не спутать «продукт стал лучше» с «состав пользователей поменялся». Это самая частая ловушка продуктовых цифр, и собес проверяет, видишь ли ты её.

Стержень: средний тренд обманчив; смотреть надо когортами и внутри сегментов, иначе mix shift и парадокс Симпсона нарисуют что угодно.

// Формулировки: «зачем когортный анализ?», «что такое ретеншн-треугольник?», «как парадокс Симпсона портит выводы?».

Когорта и ретеншн-треугольник

Когорта - группа, объединённая временем общего события: неделя регистрации, месяц первого заказа. Сравнение когорт отделяет улучшение продукта от того, что пользователи просто «постарели».

Когортная таблица (ретеншн-треугольник): строки - когорты, столбцы - их возраст. Читается по двум направлениям: вертикаль (одинаковый возраст у разных когорт) показывает изменения продукта во времени, горизонталь - жизненный цикл одной когорты.

// Поэтому свежие когорты нельзя оценивать по последним столбцам - там ретеншн «ещё не успел упасть». Сравнивают когорты в одинаковом возрасте.

когорта
группа с общим временем стартового события
ретеншн-треугольник
когорты × возраст: таблица удержания

Mix shift и парадокс Симпсона

Смещение состава (mix shift): метрика выросла не потому, что стало лучше, а потому что поменялся микс трафика - например, притекло больше органики, которая всегда конвертит выше. Лечится сравнением когорт внутри одного сегмента или канала.

Парадокс Симпсона - тот же зверь в острой форме: общий ARPU (average revenue per user) растёт, а внутри каждого сегмента падает, потому что микс сместился к дорогому сегменту. Вывод делают на уровне сегментов, а не агрегата.

// Практическое правило: увидел движение агрегата - первым делом разбей по ключевым срезам. Если внутри срезов картина другая, чем в целом, верь срезам.

mix shift
изменение состава трафика, маскирующееся под тренд
парадокс Симпсона
агрегат и сегменты показывают противоположное

Сегментация: по действию, не по анкете

Сегментировать полезнее по поведению, чем по демографии: частые против разовых, мобайл против веба двигаются продуктом, а пол и возраст - нет. RFM (recency, frequency, monetary) - быстрая поведенческая сегментация без всякого ML, квантованием по трём осям.

Кластеризацию (k-means и подобное) берут, когда руками сегменты не видны: но фичи надо стандартизировать, а результат - проверить на стабильность и интерпретируемость.

// Критерий здравого смысла: сегментов столько, сколько различающихся действий. Если для двух «сегментов» вы делаете одно и то же это один сегмент, а не два. Кластер без названия и действия бесполезен.

RFM
сегментация по давности, частоте, деньгам - без ML
поведенческий сегмент
группа по действиям в продукте, не по анкете

Как отвечать: «Зачем когортный анализ - что он даёт поверх среднего?»

Средняя по всем пользователям смешивает тех, кто с продуктом давно, и новичков, поэтому по ней нельзя понять, продукт стал лучше или просто состав аудитории сдвинулся. Когорты это развязывают: я группирую людей по времени старта и сравниваю их в одинаковом возрасте. Тогда вертикаль ретеншн-треугольника честно показывает, влияют ли мои релизы на удержание, а горизонталь - как живёт одна когорта. Это же защищает от mix shift и парадокса Симпсона: агрегатная метрика может расти, пока внутри каждого сегмента она падает, просто микс сместился к дорогому сегменту. Поэтому любое движение агрегата я первым делом разбиваю на когорты и сегменты и делаю вывод на их уровне, а не на уровне общей цифры.

Почему это сильный ответ: назван корень (среднее смешивает возраст и состав), объяснено чтение треугольника и связка с mix shift / Симпсоном - именно то, ради чего когорты и нужны.

На чём валят

  • Сравнить «юзеров января» с «юзерами июня» без учёта возраста когорты.
  • Тренд метрики без разбивки по каналам - mix shift притворяется ростом продукта.
  • Сегментация ради сегментации: 15 кластеров, к которым нет 15 разных действий.
  • k-means без стандартизации фичей - кластеры по самой крупной шкале.
  • Смотреть только свежие когорты, где ретеншн «ещё не успел упасть».

Проверьте себя

Пять вопросов из банка по этой подтеме. Всего их 15, остальные разбираются в тренажёре.

  1. #cohorts_segmentation1 / 5
    Общий retention падает, хотя внутри каждой когорты он растёт. Что это?
    A)Это явная и грубая ошибка в расчётах: подобного встречается редко на реальных данных
    B)Продукт объективно стал хуже для каждого отдельного пользователя разом
    C)Mix shift (парадокс Симпсона): выросла доля слабых когорт в общем миксе
    D)Это нормальная сезонность, которая сама выправится через пару недель
    показать ответ и разбор
    +C)Mix shift (парадокс Симпсона): выросла доля слабых когорт в общем миксе

    // разбор: Классический парадокс Симпсона: если резко вырос приток низкокачественного трафика (слабая когорта), его вес в средневзвешенном тянет общую метрику вниз, хотя каждая когорта по отдельности улучшается. Лечится взвешиванием по когортам или фиксацией состава притока при сравнении.

  2. #cohorts_segmentation2 / 5
    Зачем сегментировать метрику по источникам привлечения, а не смотреть только среднее?
    A)Обычного среднего по всему продукту достаточно, сегментация лишь усложняет отчёт
    B)Сегментация нужна для красоты дашборда перед руководством компании
    C)Источники не влияют на поведение — сегментация ничего нового не покажет
    D)Каналы дают разное качество юзеров; среднее прячет убыточный источник
    показать ответ и разбор
    +D)Каналы дают разное качество юзеров; среднее прячет убыточный источник

    // разбор: Пользователи из разных каналов сильно различаются по retention и LTV: органика обычно качественнее платного трафика. Среднее по продукту прячет, что один дорогой канал тихо съедает бюджет с отрицательной юнит-экономикой. Сегментация по источнику — основа решений о перераспределении маркетинг-денег.

  3. #cohorts_segmentation3 / 5
    Как ошибка выжившего (survivorship bias) искажает анализ «активных» пользователей?
    A)Глядя лишь на оставшихся, теряешь ушедших — выводы систематически смещены
    B)Ошибка выжившего редко встречается в продуктовой аналитике данных
    C)Она проявляется в задачах компьютерного зрения
    D)Активные пользователи репрезентативны для всей базы
    показать ответ и разбор
    +A)Глядя лишь на оставшихся, теряешь ушедших — выводы систематически смещены

    // разбор: Анализируя только оставшихся активных, легко сделать смещённый вывод: «активные обожают фичу X» может означать лишь, что все, кому X не зашла, уже ушли и не попали в выборку. Правильно смотреть когортно, удерживая в поле зрения и отвалившихся, — иначе оптимизируешь продукт под тех, кто и так остался.

  4. #cohorts_segmentation4 / 5
    Что такое RFM-сегментация клиентов?
    A)Деление по давности (Recency), частоте (Frequency) и сумме покупок (Monetary)
    B)Случайное разбиение клиентов на три равные по размеру группы для теста
    C)Сортировка клиентов строго по алфавиту их имён и фамилий
    D)Сегментация всех пользователей по конкретному типу и модели их мобильного устройства
    показать ответ и разбор
    +A)Деление по давности (Recency), частоте (Frequency) и сумме покупок (Monetary)

    // разбор: RFM ранжирует клиентов по трём осям: давность последней покупки (Recency), частота (Frequency) и суммарные траты (Monetary). Простая, но мощная модель для таргетинга: «недавние частые крупные» — VIP, «давно не покупали, но раньше активные» — кандидаты на реактивацию. Помогает решить, кому и что слать.

  5. #cohorts_segmentation5 / 5
    Как устроена когортная таблица удержания (retention triangle)?
    A)Каждая её ячейка показывает суммарную выручку всего продукта за один день
    B)Строки в ней — это отдельные пользователи, а столбцы — их персональные анкетные данные профиля
    C)Это по сути случайная матрица чисел без какой-либо внутренней временной структуры вообще
    D)Строки — когорты по дате старта, столбцы — возраст; в ячейке retention этого возраста
    показать ответ и разбор
    +D)Строки — когорты по дате старта, столбцы — возраст; в ячейке retention этого возраста

    // разбор: В retention-треугольнике строка — когорта (пришедшие в неделю/месяц), столбец — возраст когорты (0, 1, 2… периода с момента старта), в ячейке — доля активных этого возраста. Вдоль строки видно, как стареет одна когорта; вдоль столбца сравнивают когорты на одинаковом возрасте; по диагонали — календарное время. «Треугольник» — потому что свежие когорты ещё не дожили до старших возрастов.

дальше

Теорию прочитали. Навык ставится повторением

В Сеньорчике эта подтема идёт в ежедневных сессиях: движок возвращает её, пока ответы не станут уверенными, и ведёт прогресс отдельно по каждой подтеме. Теория внутри тоже бесплатна, лимит только на количество вопросов в день.