сеньорчикОткрыть в Telegram
← блог
21 июля 2026 г.

A/B-тест простыми словами: как устроен, что считать и где обычно ошибаются

A/B-тест выглядит просто: показали половине пользователей одну версию, половине другую, посмотрели, где метрика выше. На этом простота заканчивается, потому что дальше начинаются вопросы, на которых разваливается большинство экспериментов в компаниях.

Разберём механику и грабли.

Зачем нужен

Чтобы отделить эффект изменения от всего остального шума: сезонности, рекламной кампании, дня недели, погоды.

Сравнить «до и после» недостаточно: между периодами меняется слишком многое. Разделение на две группы в один момент времени решает эту проблему, потому что обе группы живут в одинаковых условиях.

Как устроен правильный тест

Гипотеза до запуска. Не «посмотрим, что будет», а «если убрать лишний шаг из формы, конверсия в оплату вырастет, потому что часть людей отваливается именно там». Формулировка гипотезы заранее защищает от подгонки выводов под результат.

Одна главная метрика. Та, по которой принимается решение. Остальные считаются, но как дополнительные и как страховка от вреда: конверсия выросла, а средний чек не просел?

Расчёт размера выборки до старта. Считается из трёх вещей: текущего уровня метрики, минимального эффекта, который вам важно поймать, и допустимых вероятностей ошибок. Без этого расчёта тест либо будет вечным, либо закончится ничем.

Случайное деление. Пользователи, а не сессии, и с фиксацией: человек, попавший в группу А, должен видеть версию А всегда. Иначе эффект размажется.

Фиксированная длительность. Определяется заранее и не меняется по ходу. Минимум неделя, чтобы захватить полный цикл дней, обычно две.

Что означает результат

Тест закончился, и вы получили p-value. Что оно означает: вероятность увидеть такую или большую разницу между группами, если на самом деле разницы нет.

Что оно не означает: вероятность того, что ваша гипотеза верна. Это самая частая ошибка трактовки, и её же чаще всего спрашивают на собеседовании.

Практический смысл: маленькое p-value говорит, что случайностью такую разницу объяснить трудно. Но оно ничего не говорит о размере эффекта. Поэтому смотреть надо на доверительный интервал: он отвечает сразу на два вопроса, есть ли разница и насколько она большая.

Разница значима статистически, но интервал от 0.1% до 0.4%? Значит эффект есть, но его может не хватить, чтобы окупить разработку.

Пять способов испортить эксперимент

Подглядывание. Смотреть результаты каждый день и остановиться, когда «прокрасилось». Это самый популярный способ получить ложный результат: при ежедневных проверках вероятность случайно увидеть значимость вырастает в разы.

Множественные метрики. Посчитали двадцать показателей, один оказался значимым, о нём и рассказали. При двадцати проверках на уровне значимости 5% один случайный успех почти гарантирован.

Слишком короткий тест. Три дня, из них два выходных. Поведение в выходные другое, и результат будет про выходные, а не про изменение.

Неравные группы. Не по размеру, а по составу: в одну попали в основном новые пользователи, в другую старые. Проверяется до анализа сравнением групп по ключевым характеристикам.

Утечка между группами. Пользователь видит обе версии с разных устройств, или изменение влияет на всех сразу, как в случае с ценами и рекомендациями.

Что делать, если результат незначим

Незначимый результат это не «эффекта нет». Это «данных не хватило, чтобы его различить».

Дальше есть варианты. Посмотреть на доверительный интервал: если он узкий и лежит около нуля, эффекта действительно, скорее всего, нет. Если широкий, вы просто ничего не узнали, нужна большая выборка или более сильное изменение.

И самое важное: незначимый результат тоже результат. Он экономит команде месяцы разработки того, что не работает. Проблема начинается, когда его пытаются переинтерпретировать: «ну там же был плюс 0.2%, давайте выкатим».

Когда A/B-тест не подходит

Не всё можно проверить экспериментом, и на собеседовании про это спрашивают отдельно.

Изменение затрагивает всех сразу: смена цен, ребрендинг, новая политика доставки.

Эффект сетевой: соцсеть, маркетплейс, любой продукт, где пользователи влияют друг на друга.

Метрика проявляется через полгода: удержание годовых подписчиков, LTV.

Мало трафика: на пятистах пользователях в неделю поймать изменение конверсии в один процент не выйдет.

В этих случаях идут другие подходы: разность разностей, синтетический контроль, переключение по географии или по времени. Каждый со своими допущениями, и вот про допущения обычно и просят рассказать.

Что спрашивают на собеседовании

Стандартный набор: что такое p-value и что оно не означает, ошибки первого и второго рода, как считается размер выборки, почему нельзя подглядывать, что делать с незначимым результатом, как проверить корректность разделения.

Часто дают кейс: «мы выкатили фичу на 10% пользователей, конверсия выросла на 5%, что скажете?» Ждут, что вы спросите про длительность, размер выборки, способ деления и как считалась значимость, а не сразу обрадуетесь.

Разбор этих вопросов с вариантами ответов есть в Сеньорчике: отдельные блоки по статистике, A/B-тестам и продуктовым метрикам, каждый вопрос с разбором, а движок возвращает темы, где вы ошибаетесь. Десять минут в день в Telegram, начать можно бесплатно.