Оценка эффекта фичи
Выкатили новую корзину, продажи выросли на 8 процентов. Смотрим десять недель до релиза: недельная выручка гуляла между 5,9 и 6,4 миллиона сама по себе, размах около пяти процентов без всяких изменений. Восемь процентов на этом фоне - уже не шум, но ещё и не доказательство: в ту же неделю шла рассылка и началась зарплатная неделя месяца.
Стержень: базовый замер до, контрольная группа для отделения внешних причин, критерий успеха объявлен заранее.
// Формулировки: «продажи выросли на 8% после релиза», «показатель +2% при разбросе 5%», «эффект исчез через месяц»
База и обычный разброс
Без значения «до» сравнивать не с чем. Снимают его заранее и за несколько периодов подряд, а не за одну предыдущую неделю: одна неделя сама может оказаться выбросом.
Главное, что даёт история, - размер обычного колебания. Если показатель без всяких изменений гуляет на пять процентов, то прирост в два процента ничего не значит: такая же разница возникает между двумя случайными неделями. Чтобы поймать маленький эффект, нужно либо больше данных, либо сравнение групп.
// Практическое следствие: величину, которую есть смысл ловить, обсуждают до эксперимента. Если бизнесу интересен только рост от пяти процентов, а поймать при текущем трафике можно от восьми, эксперимент бесполезен, и лучше узнать это заранее.
Контрольная группа против совпадений
Совпадение по времени не доказывает причину. Параллельно шла рекламная кампания, началась сезонность, конкурент поднял цены, у маркетплейса была распродажа. Всё это молча записывается в заслугу фиче.
Контрольная группа живёт в том же периоде под теми же влияниями и отличается ровно одним - изменения у неё нет. Разница между группами и есть эффект. Сезонность, реклама и конкуренты действуют на обе группы одинаково и потому вычитаются.
// Когда группы не поделить - изменение общее для всех, например новый тариф, - сравнивают с похожим сегментом, где изменение ещё не включили: другой город, другой филиал, другая платформа. Хуже, чем честное деление, но лучше, чем «до и после».
Новизна и затухание
Новый элемент привлекает внимание сам по себе. Первая неделя даёт плюс двенадцать процентов, четвёртая - плюс один: любопытство кончилось, осталось реальное поведение.
Отсюда два правила. Замерять на устоявшемся периоде, а не в первые дни. И обязательно возвращаться к замеру через месяц-другой, иначе в компании копится набор мнимых улучшений, каждое из которых когда-то отчиталось ростом.
// Бывает и обратное - эффект обучения. Люди привыкли к старому интерфейсу, первую неделю тормозят, показатель падает, а через две недели уходит вверх. Ранний замер тут похоронит хорошее изменение.
Считать совокупно
Конверсия выросла на 0,4 процентного пункта. При ста тысячах визитов в месяц это 400 дополнительных заказов, по 257 рублей маржи - около 103 тысяч рублей. Победа.
Теперь вторая половина. Обращений в поддержку прибавилось на 300 в месяц, каждое стоит около 250 рублей - это 75 тысяч. Чистый эффект 28 тысяч вместо 103, и он держится только пока не выросла нагрузка дальше. Заодно всплывает причина: люди пишут, потому что новый шаг непонятен, и его дешевле починить, чем оплачивать поддержкой.
// И дисциплина, без которой всё остальное не работает: критерий успеха объявляют до эксперимента. Без порога любой итог объявляется победой - конверсия не выросла, зато выросло время на странице.
Как отвечать: «После релиза продажи выросли на 8%. Это заслуга фичи?»
Пока сказать нельзя, и я бы назвал три причины сомневаться. Первая: в тот же период могли действовать другие силы - рекламная кампания, сезонность, цены конкурента. Совпадение по времени причину не доказывает, поэтому нужна контрольная группа, которая живёт в том же периоде без изменения. Вторая: обычный разброс. Если недельная выручка сама по себе гуляет на пять процентов, восемь вполне могут оказаться шумом, и это видно из истории за десять недель до релиза. Третья: эффект новизны - первые дни часто дают всплеск из интереса, поэтому я бы перемерил через месяц. И отдельно посчитал бы издержки рядом: если вместе с конверсией выросла нагрузка на поддержку, чистый эффект будет заметно меньше валового.
Кандидат называет три независимые причины сомневаться, по каждой даёт способ проверки и добавляет счёт по совокупности.
На чём валятся
- −− Приписывают фиче рост, совпавший с ней по времени.
- −− Берут базой одну предыдущую неделю и не знают обычного разброса.
- −− Замеряют в первые дни и принимают новизну за результат.
- −− Оценивают только целевую метрику, игнорируя издержки в соседних процессах.
- −− Не объявляют критерий успеха заранее и подгоняют его под итог.
- −− Запускают эксперимент, в котором нужный эффект физически не поймать при текущем трафике.
Проверьте себя
Пять вопросов из банка по этой подтеме. Всего их 12, остальные разбираются в тренажёре.
- Бизнес хочет считать эффект автоматизации в сэкономленных часах. В чём подвох?A)Часы трудно перевести в деньгиB)Часы не всегда становятся деньгамиC)Часы измеряются с большой погрешностьюD)Экономия часов не интересует руководство
показать ответ и разбор
+B)Часы не всегда становятся деньгами// разбор: Если освободившееся время не занято другой полезной работой и штат не сокращён, затраты компании не изменились. Экономия становится деньгами, когда переходит либо в дополнительный объём работы теми же людьми, либо в реальное сокращение расходов. Это стоит проговаривать при защите проекта.
- Показатель улучшился на 2%, а обычный разброс между неделями — 5%. Какой вывод?A)Изменение неотличимо от обычных колебанийB)Эффект отрицательный по сутиC)Эффект есть, но небольшойD)Нужно немедленно раскатить изменение на всех
показать ответ и разбор
+A)Изменение неотличимо от обычных колебаний// разбор: Сдвиг внутри обычного разброса ничего не доказывает: такая же разница возникает между двумя случайными неделями без всяких изменений. Нужны либо больше данных, либо сравнение с контрольной группой. Объявлять победу по такому результату — верный способ накопить набор мнимых улучшений.
- Фича улучшила конверсию, но выросла нагрузка на поддержку. Как оценивать итог?A)По целевому показателю конверсииB)По совокупному эффекту с издержкамиC)По отзывам пользователей о новинкеD)По числу обращений в поддержку
показать ответ и разбор
+B)По совокупному эффекту с издержками// разбор: Оценка только по целевой метрике позволяет выиграть в одном месте, проиграв больше в другом. Считают суммарно: прирост дохода от конверсии минус стоимость дополнительных обращений. Нередко выясняется, что рост нагрузки — сигнал о непонятном интерфейсе, и его дешевле починить.
- Через месяц после релиза эффект исчез. Что это чаще всего означает?A)Расчёт эффекта был выполнен неверноB)Изменение сломалось в очередном релизеC)Пользователи не заметили измененияD)Сработал эффект новизны у пользователей
показать ответ и разбор
+D)Сработал эффект новизны у пользователей// разбор: Новый элемент привлекает внимание сам по себе, и первые недели показатель растёт просто из-за любопытства. Когда новизна проходит, поведение возвращается к прежнему. Поэтому эффект замеряют не в первые дни, а на устоявшемся периоде, и обязательно проверяют его сохранность позже.
- Почему полезно заранее объявить, какой результат будет считаться успехом?A)Так требуется процедурой согласованияB)Иначе результат подгонят под любой исходC)Так проще выбрать инструмент аналитикиD)Иначе труднее посчитать доверительный интервал
показать ответ и разбор
+B)Иначе результат подгонят под любой исход// разбор: Без заранее объявленного порога любой итог объявляется победой: не выросла конверсия — зато выросло время на странице. Заранее зафиксированный критерий и срок наблюдения делают проверку честной и позволяют вовремя откатить то, что не сработало.
дальше
Теорию прочитали. Навык ставится повторением
В Сеньорчике эта подтема идёт в ежедневных сессиях: движок возвращает её, пока ответы не станут уверенными, и ведёт прогресс отдельно по каждой подтеме. Теория внутри тоже бесплатна, лимит только на количество вопросов в день.