сеньорчикОткрыть в Telegram
← вся теориятеория к собесу · Статистика

Доверительный интервал: что он означает

Зачем это спрашивают

Доверительный интервал - язык, на котором рассказывают про эксперименты. Не «фича сработала», а «прирост 2.1%, интервал от 0.4% до 3.8%». Проверяют два места: правильно ли ты читаешь эти 95% и различаешь ли разброс данных и разброс оценки. Третий вопрос - что делать, когда готовой формулы нет.

Типовые формулировки: «что означает 95% в доверительном интервале?», «чем стандартная ошибка отличается от стандартного отклонения?», «как построить интервал для медианы?».

// Логика интервьюера простая: кто путается в интервалах, тому не дадут интерпретировать A/B.

Что на самом деле значит «95%»

Тут почти все ошибаются, и ошибка настолько привычная, что звучит естественно. Хочется сказать: «истинное среднее лежит в этом интервале с вероятностью 95%». Так говорить нельзя, и вот почему.

В частотном подходе истинное среднее - фиксированное число. Оно либо внутри твоего интервала, либо снаружи, никакой вероятности тут уже нет, вопрос просто решён, ты только не знаешь ответа. А 95% - это свойство процедуры: если повторить эксперимент тысячу раз и каждый раз строить интервал по той же схеме, примерно 950 из этих интервалов накроют истинное значение. Ты не знаешь, попал ли конкретно твой. Ты знаешь, что метод попадает в 95 случаях из ста.

// Фраза «параметр здесь с вероятностью 95%» тоже законна, но описывает другую конструкцию - байесовского credible interval. На собесе это различие любят проверять дословно, так что стоит уметь произнести обе версии.

credible interval
байесовский интервал; вот про него как раз можно сказать «параметр внутри с вероятностью 95%»

Стандартная ошибка: разброс оценки, а не данных

Интервал для среднего строится просто: точка ± квантиль × SE. Квантиль - это множитель из таблицы распределения, для 95% и нормального он равен знакомым 1.96. А SE (standard error), стандартная ошибка, считается как s/√n, где s - разброс самих данных, а n - размер выборки.

Вот тут и живёт различие, которое проверяют. Стандартное отклонение s описывает, насколько разбросаны данные: люди бывают разного роста, и от того, что ты измерил больше людей, они одинаковыми не станут. А стандартная ошибка описывает, насколько шатается твоя оценка среднего. И она как раз падает с ростом выборки - в √n раз.

// Отсюда неприятная арифметика: ширина интервала ведёт себя как 1/√n, поэтому сузить его вдвое стоит вчетверо больше данных. А для долей обычная формула p̂ ± z·√(p̂(1−p̂)/n) работает, пока успехов и неуспехов набралось прилично; при трёх успехах из двадцати или при доле у самого края она начинает врать, там берут интервал Уилсона.

квантиль
множитель из распределения под нужный уровень доверия; для 95% и нормального это 1.96
интервал Уилсона
формула интервала для доли, честная на малых выборках и крайних долях

Бутстрэп: когда формулы нет вообще

Для среднего формула известна. А для медианы, перцентиля или отношения двух метрик - нет. И тут выручает приём, который на первый взгляд похож на жульничество.

Бутстрэп: берёшь свою выборку и составляешь из неё новую того же размера, вытаскивая элементы наугад и возвращая их обратно, так что один и тот же может попасть несколько раз. На этой новой выборке считаешь медиану. Повторяешь пару тысяч раз. Получается облако медиан, и границы центральных 95% этого облака и есть твой интервал. Логика такая: если выборка более-менее представляет генеральную совокупность, то вытаскивание из неё имитирует повторение эксперимента.

// Интервалы и тесты - одно и то же с разных сторон: если 95%-интервал разности не накрывает ноль, двусторонний тест значим на α = 0.05. Но интервал информативнее: «+2.1% [0.4%; 3.8%]» показывает и величину, и неопределённость, а «p < 0.05» не показывает ни того, ни другого.

бутстрэп
тысячи раз пересобрать выборку из себя самой с возвращением и посмотреть, как гуляет оценка
перцентиль
значение, ниже которого лежит заданный процент наблюдений

Как отвечать: «Как построишь доверительный интервал для медианы?»

Аналитической формулы, как для среднего, тут нет, поэтому беру бутстрэп. Несколько тысяч раз пересобираю выборку из неё самой с возвращением, того же размера, на каждой пересборке считаю медиану, а потом из распределения этих медиан беру перцентили два с половиной и девяносто семь с половиной. Тот же приём закрывает любые квантили и отношения метрик, где формулы тоже нет. В A/B я так строю интервал для разности медиан между группами и смотрю, накрывает ли он ноль.

Названа процедура целиком и сразу показано, как ей пользуются для решения. Не «есть такой метод бутстрэп», а что именно ты делаешь руками.

На чём валят

  • Читать частотный интервал как «параметр внутри с вероятностью 95%». Так можно сказать только про байесовский credible interval.
  • Путать стандартное отклонение данных и стандартную ошибку оценки: вторая меньше в корень из n раз и означает совсем другое.
  • Строить нормальный интервал для доли при трёх успехах из двадцати: аппроксимация там уже не работает, нужен Уилсон или точный метод.
  • Сравнивать группы по тому, перекрываются ли их интервалы. Перекрытие бывает и при значимой разнице; смотреть надо интервал разности.

Проверьте себя

Пять вопросов из банка по этой подтеме. Всего их 13, остальные разбираются в тренажёре.

  1. #confidence_intervals1 / 5
    Как изменится ширина доверительного интервала для среднего, если увеличить выборку в 4 раза (при прочих равных)?
    A)Уменьшится в 16 раз
    B)Уменьшится в 2 раза
    C)Уменьшится в 4 раза
    D)Не изменится совсем
    показать ответ и разбор
    +B)Уменьшится в 2 раза

    // разбор: Ширина пропорциональна стандартной ошибке σ/√n: рост n в 4 раза сжимает интервал в √4 = 2 раза. Отсюда неприятное следствие для экспериментов: чтобы поймать вдвое меньший эффект, нужна вчетверо большая выборка — точность стоит квадратично.

  2. #confidence_intervals2 / 5
    Чем стандартная ошибка среднего (SE) отличается от стандартного отклонения (std)?
    A)Стандартная ошибка SE и стандартное отклонение std — это в точности одно и то же
    B)std — разброс данных; SE = std/√n — разброс среднего, падает с ростом n
    C)SE измеряет разброс сырых данных, а std — разброс среднего по выборкам
    D)SE больше std, потому что учитывает размер всей выборки
    показать ответ и разбор
    +B)std — разброс данных; SE = std/√n — разброс среднего, падает с ростом n

    // разбор: std описывает разброс самих наблюдений, а SE = std/√n — насколько точно оценено среднее: с ростом выборки среднее оценивается точнее, поэтому SE уменьшается как 1/√n, тогда как std от размера выборки не зависит. Доверительный интервал для среднего строят именно через SE, а не std.

  3. #confidence_intervals3 / 5
    Два 95%-х доверительных интервала для средних слегка перекрываются. Можно ли заключить, что разница незначима?
    A)Да, перекрытие доверительных интервалов — это строгий и достаточный признак статистически незначимой разницы между средними групп
    B)Наоборот: перекрытие интервалов доказывает статистически значимую разницу между группами
    C)Нет: перекрытие ДИ не эквивалентно тесту разницы; строят ДИ для разности средних и смотрят, накрывает ли он ноль
    D)Перекрытие хотя бы на процент длины интервалов — железное доказательство полного отсутствия значимой разницы между средними
    показать ответ и разбор
    +C)Нет: перекрытие ДИ не эквивалентно тесту разницы; строят ДИ для разности средних и смотрят, накрывает ли он ноль

    // разбор: Перекрытие двух отдельных ДИ и значимость разницы — не одно и то же: интервалы могут перекрываться, а разница быть значимой (и реже наоборот). Причина — дисперсия разности складывается иначе, чем ширины двух интервалов. Корректно построить доверительный интервал для самой разности средних (или провести тест) и проверить, накрывает ли он ноль. «Правило перекрытия» — распространённая ошибка.

  4. #confidence_intervals4 / 5
    Чем доверительный интервал для среднего отличается от интервала прогноза (prediction interval) для нового наблюдения?
    A)Это синонимы: оба интервала описывают одно и то же и имеют одинаковую ширину на данных выборки
    B)Prediction interval уже доверительного, ведь предсказать одно значение проще, чем оценить среднее по выборке
    C)Доверительный — про неопределённость ОЦЕНКИ среднего (сужается с n); prediction — про разброс отдельного наблюдения (шире, включает и дисперсию данных)
    D)Доверительный интервал не зависит от размера выборки, а prediction interval — зависит от n
    показать ответ и разбор
    +C)Доверительный — про неопределённость ОЦЕНКИ среднего (сужается с n); prediction — про разброс отдельного наблюдения (шире, включает и дисперсию данных)

    // разбор: Доверительный интервал оценивает, где лежит СРЕДНЕЕ (параметр): его ширина ∝ SE и сужается с ростом n (при больших n почти схлопывается). Интервал прогноза оценивает, где окажется ОТДЕЛЬНОЕ новое наблюдение, поэтому включает и неопределённость среднего, и собственную изменчивость данных (σ) — он ЗАМЕТНО ШИРЕ и с ростом n к нулю не стягивается. Их часто путают. Оба зависят от n, но по-разному.

  5. #confidence_intervals5 / 5
    От чего зависит ширина доверительного интервала для среднего?
    A)От значения самого среднего: чем больше среднее, тем шире интервал, а разброс данных и объём выборки на ширину не влияют
    B)От разброса данных, размера выборки и уровня доверия: больше дисперсия/выше доверие — шире; больше n — уже
    C)Ширина доверительного интервала ни от чего не зависит и жёстко фиксирована по стандарту на уровне ±1.96 единицы
    D)От уровня доверия; ни размер выборки, ни дисперсия данных на ширину интервала для среднего не влияют
    показать ответ и разбор
    +B)От разброса данных, размера выборки и уровня доверия: больше дисперсия/выше доверие — шире; больше n — уже

    // разбор: Ширина CI для среднего ≈ 2·z·(σ/√n), поэтому растёт с разбросом данных σ и с уровнем доверия (95% → 99% берёт больший z), а сужается с ростом объёма выборки как 1/√n (учетверение n сужает интервал вдвое). Само значение среднего на ширину не влияет. Компромисс: уже интервал требует либо больше данных, либо меньшей уверенности. Фиксированного «±1.96» в исходных единицах нет — это множитель на стандартизованной шкале.

дальше

Теорию прочитали. Навык ставится повторением

В Сеньорчике эта подтема идёт в ежедневных сессиях: движок возвращает её, пока ответы не станут уверенными, и ведёт прогресс отдельно по каждой подтеме. Теория внутри тоже бесплатна, лимит только на количество вопросов в день.