Перейти к содержимому

6.4 Выборка, ошибка и честные выводы

11 класс · Данные◷ 60–70 минут◇ БазаНужно знать: ожидание и дисперсия, правило трёх сигм, схема Бернулли, проценты

Заголовок новости: «54%54\% жителей поддержали проект». Ниже мелким шрифтом: опрошено 16001600 человек.

В городе живёт миллион. Опросили полторы тысячи — это полторы десятых процента населения. И на основании этого делается утверждение обо всех. Звучит как подлог.

Но это не подлог. Это работающий метод — при двух условиях, которые почти никогда не пишут в заголовке.

Вопрос урока: насколько можно доверять числу, полученному по выборке, и какой вывод из него имеешь право сделать?

  1. Опросили 16001600 человек из миллиона. Насколько, по-твоему, результат может отличаться от истинной доли: на десятые доли процента, на пару процентов или на десять?
  2. Чтобы опрос стал вдвое точнее, во сколько раз надо увеличить число опрошенных?
  3. Для города в миллион жителей и для страны в сто миллионов нужны выборки одинакового объёма или разного?

Пусть в населении ровно 35\frac35 сторонников. Опросим двенадцать случайных человек. Сколько из них скажут «да»?

Лаборатория нормальной модели

Откуда берётся колокол

Ни кубик, ни монета сами по себе на колокол не похожи. Увеличивай число слагаемых и смотри, как форма распределения суммы меняется сама собой.

σ = 1,697
От 1 до 15; испытания независимы, вероятность успеха в каждом одна и та же.
Чем дальше p от 1/2, тем несимметричнее картинка и тем позже она становится похожей на колокол.

Серия из 12 независимых испытаний, вероятность успеха в каждом равна 3/5 (сторонник проекта в опросе).

Распределение суммы и нормальная криваяСтолбчатая диаграмма распределения: по горизонтали число успехов от 0 до 12, по вертикали вероятность от 0 до 0,25. Кривая нормальной модели и полоса ± σ скрыты: сначала выбери ответ и нажми «Проверить».
Полосы вокруг среднего: точный расчёт против нормальной модели
ПолосаГраницыТочная вероятностьПриближённоНормальная модель
M ± 1σ5,58,9??0,6827
M ± 2σ3,8110,59??0,9545
M ± 3σ2,1112,29??0,9973

Точные вероятности вычислены по распределению, без всякого нормального приближения: сравнение $(x-M)^2\le k^2D$ обходится без извлечения корня. Последний столбец — то, что обещает модель; расхождение показывает, насколько модель уже пригодна.

Выбери прогноз для полосы M(X) ± σ и нажми «Проверить».Подсказка: посмотри, какая часть столбиков попадает внутрь выделенной полосы.

Ожидание равно 1235=7,212\cdot\frac35=7{,}2 человека, но реально выпасть может и пять, и десять. Доля в такой выборке — это X12\frac{X}{12}, и она гуляет вместе с XX. Увеличивай nn ползунком: горб становится острее относительно своей ширины — колебания доли уменьшаются.

Возьмём выборки побольше. Вот двадцать независимых опросов по 100100 человек в населении, где сторонников ровно 60%60\% (расчёт воспроизводимый, у тебя получатся те же числа):

12345678910
доля, %6666565663635555555557576363676763636464
11121314151617181920
доля, %5454575753535959585857576262606060605454

Ровно 60%60\% выпало лишь в двух опросах из двадцати. Разброс — от 53%53\% до 67%67\%, среднее по всем двадцати опросам равно 59,15%59{,}15\%. Это и есть ошибка выборки: она возникает не от небрежности, а от самого факта, что опрошены не все.

Хорошая новость: эта ошибка подчиняется формуле из урока 6.2.

Пусть в населении доля сторонников равна pp, а мы опрашиваем nn человек независимо. Число сторонников в выборке — величина из схемы Бернулли: M=npM=np, D=np(1p)D=np(1-p). Доля p^=Xn\hat p=\frac{X}{n} получается делением на nn, значит её дисперсия делится на n2n^2:

D(p^)=np(1p)n2=p(1p)n.D(\hat p)=\frac{np(1-p)}{n^2}=\frac{p(1-p)}{n}.

Правило Δ1n\Delta\approx\frac{1}{\sqrt n} считается в уме: n=400n=400 даёт 55 процентных пунктов, n=1600n=16002,52{,}5, n=2500n=250022, n=10000n=10\,00011. Теперь понятно, откуда берётся стандартный объём социологического опроса: полторы-две тысячи человек — это точность около двух пунктов, а дальнейшее уточнение стоит непропорционально дорого.

Тот самый заголовок: 54 % из 1600Разбираем вместе

Оценка. p^=0,54\hat p=0{,}54, n=1600n=1600.

Стандартная ошибка. σp^=0,540,461600=0,24841600=0,000155250,0125\sigma_{\hat p}=\sqrt{\dfrac{0{,}54\cdot0{,}46}{1600}}=\sqrt{\dfrac{0{,}2484}{1600}}=\sqrt{0{,}00015525}\approx0{,}0125, то есть 1,251{,}25 процентного пункта.

Граница ошибки. Δ20,0125=0,025\Delta\approx2\cdot0{,}0125=0{,}025 — два с половиной пункта.

Ответ в честной форме. Доля сторонников составляет 54%±2,554\%\pm2{,}5 пункта, то есть лежит примерно между 51,5%51{,}5\% и 56,5%56{,}5\% — с надёжностью около 95%95\%.

Какой вывод отсюда следует. Весь интервал лежит выше 50%50\%, поэтому утверждение «сторонников больше половины» обосновано. А вот утверждение «сторонников ровно 54%54\%» — нет: точного числа опрос не даёт и дать не может.

А если бы опросили 400400 человек? Тогда σp^=0,24844000,0249\sigma_{\hat p}=\sqrt{\dfrac{0{,}2484}{400}}\approx0{,}0249 и Δ5\Delta\approx5 пунктов. Интервал 49%59%49\%\ldots59\% пересекает половину, и вывод «сторонников большинство» рассыпается. Те же 54%54\% в заголовке — но выводы противоположные по надёжности. Вот почему объём выборки обязан быть указан рядом с процентом.

Обратная задача: сколько человек опросить

Заголовок раздела «Обратная задача: сколько человек опросить»

Из Δ1n\Delta\le\frac{1}{\sqrt n} получаем n1Δ2n\ge\frac{1}{\Delta^2} (для надёжности 95%95\% и худшего случая p=12p=\frac12):

Нужная точность Δ\Delta55 п.п.33 п.п.22 п.п.11 п.п.
Минимальный объём nn40040011121112250025001000010\,000

Проверь по строке сам: 10,032=10,00091111,1\frac{1}{0{,}03^2}=\frac{1}{0{,}0009}\approx1111{,}1, поэтому берём 11121112 — объём выборки округляют только вверх.

Проверка понимания

Опрос 400 человек дал 54 % сторонников. Какой вывод корректен?

Два условия, без которых всё это не работает

Заголовок раздела «Два условия, без которых всё это не работает»

Формула ошибки описывает только одну неприятность — случайное колебание. Есть вторая, куда опаснее.

Второй способ ошибиться — правильно посчитать связь и неправильно её объяснить.

Вот данные по месяцам с апреля по октябрь: продажи мороженого (тысячи порций) и число несчастных случаев на воде.

МесяцIVVVIVIIVIIIIXX
Мороженое, тыс. порций1818242431314545585866667171
Несчастные случаи33554499111110101414

Коэффициент корреляции равен r0,95r\approx0{,}95 — связь очень сильная и положительная. Значит ли это, что мороженое опасно?

Ещё пример: у школьников 771414 лет размер обуви и скорость чтения связаны почти идеально, r0,99r\approx0{,}99. Обувь тут ни при чём: общая причина — возраст. Как только сравнение делается внутри одного возраста, связь исчезает.

  1. Опрошено 25002500 человек, доля сторонников p^=0,5\hat p=0{,}5. Найди стандартную ошибку и границу ошибки.
  2. Во сколько раз надо увеличить выборку, чтобы граница ошибки уменьшилась втрое?
  3. Какой объём выборки нужен для точности ±2\pm2 пункта? А для ±1\pm1 пункта?
  4. Опрос 400400 человек дал 54%54\%. Можно ли утверждать, что сторонников большинство?
  5. Опрос 16001600 человек дал те же 54%54\%. Изменится ли ответ на вопрос 4?
  6. При n=900n=900 и p^=0,4\hat p=0{,}4 найди границу ошибки и запиши интервал в процентах.
  7. Опрос о велодорожках провели среди подписчиков велоклуба и получили 92%92\% поддержки при n=5000n=5000. Оцени границу ошибки и объясни, почему это число здесь бесполезно.
  8. Продажи мороженого и число несчастных случаев на воде дают r0,95r\approx0{,}95. Назови настоящую причину связи.
  9. У школьников 771414 лет размер обуви и скорость чтения дают r0,99r\approx0{,}99. Что здесь общая причина и как это проверить?
  10. Как в принципе можно доказать, что AA является причиной BB?
  11. Рейтинг вырос с 51%51\% до 54%54\%; оба опроса по 16001600 человек. Что можно честно сказать о росте?
  12. Почему для города с миллионом жителей и для страны со ста миллионами нужна выборка примерно одного объёма?
Ответы и пояснения
  1. σp^=0,252500=0,0001=0,01\sigma_{\hat p}=\sqrt{\frac{0{,}25}{2500}}=\sqrt{0{,}0001}=0{,}01, то есть 11 пункт; граница ошибки Δ=2%\Delta=2\%. Интервал: от 48%48\% до 52%52\%.
  2. Вдевятеро: ошибка убывает как 1n\frac{1}{\sqrt n}, поэтому 9=3\sqrt9=3.
  3. n10,022=2500n\ge\frac{1}{0{,}02^2}=2500 и n10,012=10000n\ge\frac{1}{0{,}01^2}=10\,000.
  4. Нет. Δ=20,540,464000,05\Delta=2\sqrt{\frac{0{,}54\cdot0{,}46}{400}}\approx0{,}05, интервал 49%59%49\%\ldots59\% захватывает значения ниже половины.
  5. Да, изменится: Δ0,025\Delta\approx0{,}025, интервал 51,5%56,5%51{,}5\%\ldots56{,}5\% целиком выше 50%50\%. Теперь вывод о большинстве обоснован.
  6. σp^=0,40,6900=0,249000,0163\sigma_{\hat p}=\sqrt{\frac{0{,}4\cdot0{,}6}{900}}=\sqrt{\frac{0{,}24}{900}}\approx0{,}0163, значит Δ3,3\Delta\approx3{,}3 пункта и интервал примерно 36,7%43,3%36{,}7\%\ldots43{,}3\%.
  7. Формально Δ=20,920,0850000,0077\Delta=2\sqrt{\frac{0{,}92\cdot0{,}08}{5000}}\approx0{,}0077, меньше одного пункта. Но выборка смещена: опрошены только те, кто уже заинтересован в велодорожках. Число 92%92\% оценивает долю среди велоклуба, а не среди горожан, и никакая точность этого не исправляет.
  8. Общая причина — жара: она одновременно увеличивает и продажи мороженого, и число купающихся.
  9. Общая причина — возраст. Проверка: посмотреть связь внутри одной возрастной группы — там она пропадёт.
  10. Поставить эксперимент, в котором участники распределяются по группам случайно, а различается только воздействие AA. Тогда все прочие факторы в среднем уравниваются, и разницу можно приписать именно AA.
  11. Интервалы 48,5%53,5%48{,}5\%\ldots53{,}5\% и 51,5%56,5%51{,}5\%\ldots56{,}5\% сильно перекрываются. Честная формулировка: «данные не противоречат росту, но и не доказывают его».
  12. Потому что в формуле ошибки стоит только объём выборки nn; численность населения в неё не входит (пока население во много раз больше выборки). Точность даёт не доля опрошенных, а их количество.
  • Выборка даёт оценку p^\hat p, а не точное значение pp; отклонение неизбежно и называется ошибкой выборки.
  • Стандартная ошибка доли равна p(1p)n\sqrt{\frac{p(1-p)}{n}}, граница ошибки — две такие ошибки; в худшем случае Δ1n\Delta\approx\frac{1}{\sqrt n}.
  • Точность зависит от объёма выборки, а не от численности населения; уменьшение ошибки вдвое стоит учетверения выборки.
  • Формула ошибки не защищает от смещённого отбора: репрезентативность важнее объёма.
  • Корреляция допускает минимум четыре объяснения; причинность доказывается экспериментом со случайным распределением, а не величиной rr.

Все инструменты главы собраны: центр, разброс, форма, оценка и границы вывода. Осталось применить их там, где на кону настоящие деньги и настоящие решения, — в практикуме.

← Нормальная модель и правило трёх сигм · Дальше: практикум →

Закончил урок?

Отметь прогресс — регистрация не нужна.