Калькулятор выборки: просто посчитайте
Рассчитайте, сколько завершённых анкет потребуется для опроса при выбранной допустимой погрешности и доверительном уровне.
Калькулятор определяет необходимое количество ответов. При этом статистическая точность зависит не только от размера выборки, но и от способа отбора участников. Ниже мы объясним термины и параметры расчёта, разберём методологические ограничения и дадим чек-лист для проверки исследования перед запуском.
Калькулятор размера выборки
Рассчитали размер выборки? Создайте анкету в Questionstar.ru и начните собирать ответы.
Создать опрос бесплатно →На этой странице:
Почему нельзя заранее решить, что 100 ответов достаточно
От чего зависит размер выборки
Формула расчёта размера выборки
Почему расчёт не гарантирует репрезентативность
Когда большая выборка помогает
Сколько респондентов нужно пригласить
Когда результаты опроса не нужно переносить на всю аудиторию
Чек-лист перед запуском опроса
Что такое размер выборки
Размер выборки — это количество участников исследования, ответы которых используются для анализа и выводов.
Например, если анкету полностью заполнили 400 человек и все полученные ответы пригодны для анализа, размер итоговой выборки составляет 400 респондентов.
При этом исследователя обычно интересуют не только опрошенные люди, а более широкая группа — генеральная совокупность. Это могут быть:
- все клиенты компании;
- покупатели, оформившие заказ за последний год;
- сотрудники определённого подразделения;
- пользователи мобильного приложения;
- участники образовательной программы.
Опросить каждого представителя генеральной совокупности обычно невозможно. Поэтому для исследования отбирают только часть этой группы — выборку.
Расчёт размера выборки помогает определить, сколько завершённых анкет необходимо получить для требуемой статистической мощностью исслеования. Однако такой расчёт имеет смысл только с учётом того, как отбираются участники исследования.
При вероятностном отборе у каждого представителя изучаемой группы есть реальная и заранее определяемая вероятность попасть в выборку.
Например, в базе находятся 10 000 клиентов. Исследователь случайным образом, с равными шансами для всех, выбирает 500 из них. Тогда вероятность попасть в выборку для каждого клиента составляет:
500 / 10 000 × 100% = 5%
Проще говоря, каждый клиент имеет шанс 5 из 100 попасть в выборку. Это также можно представить как вероятность 1 к 20.
Если же ссылку на анкету просто разместить в социальной сети, равные шансы обеспечить невозможно: одни клиенты увидят публикацию, другие — нет, а участвовать будут те, кто сам решит ответить. Такой отбор не является вероятностным.
Здесь важны ещё два уточнения:
- Размер итоговой выборки определяется количеством пригодных для анализа завершённых анкет, а не числом отправленных приглашений. Если необходимо получить 400 ответов, а анкету завершает в среднем только каждый пятый приглашённый, потребуется пригласить примерно 2000 человек.
- Расчётное количество ответов само по себе не делает выборку репрезентативной. Возможность переносить результаты на генеральную совокупность зависит не только от числа участников, но и от способа их отбора, охвата нужных групп и причин, по которым некоторые приглашённые не отвечают.
Почему нельзя решить, что 100 ответов достаточно
Универсального размера выборки не существует.
Фраза «для исследования нужно не меньше тысячи человек» звучит солидно, но без описания задачи почти ничего не означает. Для одного проекта достаточно 100 ответов, для другого мало и 2000.
Необходимый объём зависит от нескольких условий:
- размера генеральной совокупности;
- допустимой погрешности;
- доверительного уровня;
- предполагаемого распределения ответов;
- количества групп, которые будут сравниваться;
- способа отбора участников.
Допустим, компания хочет узнать общую долю довольных клиентов. Это одна задача. Если затем потребуется отдельно сравнить восемь регионов, общая выборка разделится на восемь частей. Точность выводов по каждому региону окажется ниже.
Поэтому расчёт начинается не с числа респондентов, а с вопроса:
какое решение мы хотим принять по результатам исследования?
От чего зависит размер выборки
Для расчёта нужно определить четыре параметра.
1. Размер генеральной совокупности
Сначала очертите аудиторию, о которой собираетесь делать вывод.
«Наши клиенты» — слишком широкое определение. Точнее будет: «10 000 клиентов, совершивших хотя бы одну покупку за последние 12 месяцев».
Если исследование касается только новых покупателей, генеральной совокупностью будут именно они, а не вся клиентская база.
Во многих случаях точная численность аудитории неизвестна. Это не мешает расчёту: тогда используют вариант для условно бесконечной генеральной совокупности. Полученное требование к количеству ответов будет немного более консервативным.
2. Допустимая погрешность
Допустимая погрешность показывает возможное отклонение результата выборочного опроса от значения во всей генеральной совокупности из-за случайности отбора.
Предположим, 60% участников сообщили, что довольны услугой. При погрешности ±5 процентных пунктов ориентировочный диапазон составит от 55 до 65%.
Чем меньше допустимая погрешность, тем больше ответов потребуется:
- ±10 процентных пунктов могут использоваться для грубой предварительной оценки;
- ±5 процентных пунктов часто выбирают как практический ориентир;
- ±3 требуют заметно большей выборки;
- ±1 резко увеличивает стоимость и продолжительность исследования.
Если при остальных неизменных условиях уменьшить погрешность вдвое, необходимое количество наблюдений увеличится приблизительно в четыре раза. Требуемая точность должна соответствовать последствиям возможной ошибки в будущем решении.
3. Уровень надёжности, или доверительный уровень
Доверительный уровень характеризует надёжность способа построения доверительного интервала. В прикладных исследованиях часто используют уровень 95%.
Представим, что исследование многократно повторяют по одной методике: каждый раз случайно формируют новую выборку и рассчитывают доверительный интервал. При доверительном уровне 95% примерно 95 из 100 таких интервалов будут содержать истинное значение показателя для генеральной совокупности.
Это не означает, что конкретный результат «верен с вероятностью 95%». После расчёта истинное значение либо находится внутри полученного интервала, либо нет. Уровень 95% описывает работу метода при многократном повторении исследования.
Если при той же допустимой погрешности повысить доверительный уровень с 95 до 99%, потребуется больше ответов. Выбирать 99% только потому, что это число выглядит убедительнее, не стоит. Более строгий уровень оправдан, когда возможная ошибка может привести к серьёзным последствиям.
4. Предполагаемая доля признака
Предполагаемая доля признака — это ожидаемая доля людей с определённым свойством или ответом. Например, доля клиентов, довольных сервисом, покупателей, знающих бренд, или сотрудников, планирующих продолжать работу в компании.
Иногда примерное распределение уже известно из предыдущего исследования. Допустим, ранее сервисом были довольны около 70% клиентов. Тогда при расчёте можно использовать предполагаемую долю 70%.
Если надёжных предварительных данных нет, указывают 50%. При таком распределении неопределённость максимальна, поэтому требуемая выборка получается не меньше, чем при других предполагаемых долях, если остальные параметры не меняются.
Не следует вводить более удобную долю только ради уменьшения выборки. Значение, отличное от 50%, должно опираться на предыдущее качественно проведённое исследование или предварительный опрос.
Формула расчёта размера выборки
Для большой или неизвестной генеральной совокупности используют формулу:
n₀ = z² × p × (1 − p) / e²
Где:
- n₀ — необходимый размер выборки;
- z — коэффициент, соответствующий выбранному доверительному уровню;
- p — предполагаемая доля исследуемого признака;
- e — допустимая погрешность, выраженная десятичной дробью.
При доверительном уровне 95% коэффициент z приблизительно равен 1,96. Погрешность ±5 процентных пунктов записывается как 0,05, а неизвестная доля признака — как 0,5.
Если размер генеральной совокупности известен, применяется поправка на конечную совокупность:
n = n₀ / (1 + (n₀ − 1) / N)
Где:
- n — скорректированный размер выборки;
- n₀ — размер выборки для большой или неизвестной совокупности;
- N — размер генеральной совокупности.
Полученное значение округляют вверх до целого числа. Калькулятор выполняет эти вычисления автоматически.
Пример расчёта размера выборки
Возьмём распространённые параметры:
- генеральная совокупность неизвестна или очень велика;
- допустимая погрешность — ±5 процентных пунктов;
- доверительный уровень — 95%;
- предполагаемая доля признака неизвестна и принимается равной 50%.
Подставим значения в формулу:
n₀ = 1,96² × 0,5 × (1 − 0,5) / 0,05²
Получаем приблизительно 384,15. После округления вверх необходимый минимальный размер выборки составит 385 завершённых анкет.
Если генеральная совокупность состоит из 10 000 человек, поправка на её конечный размер уменьшит выборку приблизительно до 370 участников.
Для совокупности из 100 человек при тех же параметрах потребуется около 80 участников.
На первый взгляд это непривычно: в группе из 100 человек приходится опросить большую её часть, а для аудитории из миллиона не нужны сотни тысяч ответов. После определённого значения дальнейшее увеличение генеральной совокупности слабо влияет на требуемый размер выборки.
Почему расчёт не гарантирует репрезентативность
Сравним два условных исследования.
В первом получили 1000 ответов. Ссылку на анкету разместили в сообществе постоянных клиентов. Участие было добровольным, а различия между ответившими и остальной клиентской базой не анализировали.
Во втором получили 370 ответов. Участников случайным образом отбирали из актуальной клиентской базы, а затем проверяли, не оказались ли отдельные группы недостаточно представленными среди ответивших.
У первой выборки больше объём. У второй лучше организована процедура отбора.
Большое количество добровольных ответов может сделать итоговый процент менее изменчивым, но не показывает, насколько он близок к показателю всей клиентской базы. Если в опросе участвуют преимущественно лояльные клиенты, их ответы не описывают опыт людей, которые разочаровались и ушли.
Поэтому вопрос «сколько человек нужно опросить?» нельзя отделять от вопроса «как эти люди попадут в исследование?».
Американская ассоциация исследователей общественного мнения AAPOR в своих стандартах раскрытия методологии разделяет вероятностные и невероятностные выборки. Обычную ошибку выборки рассчитывают для вероятностного отбора. Для невероятностных исследований показатели точности требуют отдельной статистической модели, описания её предположений и проверки этих предположений.
Pew Research Center — независимый американский исследовательский центр, который проводит опросы общественного мнения и публикует описание используемых методов. В своей методологии национальных опросов центр рассматривает качество исследования с позиции совокупной ошибки опроса.
Помимо случайной ошибки выборки, специалисты учитывают ошибки охвата, неответов, измерения, обработки и корректировки данных.
Часть аудитории может не получить приглашение. Некоторые группы могут чаще отказываться от участия. Формулировка вопроса способна подтолкнуть к определённому ответу. Искажение может появиться при очистке, взвешивании или обработке данных.
В отдельном исследовании добровольных онлайн-выборок специалисты Pew Research Center показали, что простое увеличение количества ответов не обязательно устраняет систематическое смещение. Большая выборка может давать более устойчивый, но по-прежнему смещённый результат.
Расчёт размера выборки контролирует только одну часть возможной ошибки.
Когда большая выборка помогает
Увеличение количества участников полезно, если способ отбора остаётся корректным.
Дополнительные ответы помогают снизить случайную погрешность, точнее оценивать небольшие различия, анализировать отдельные сегменты и изучать относительно редкие ответы.
Допустим, компания получила 400 анкет и решила сравнить восемь регионов. Общая цифра выглядит достаточной, но в среднем на один регион приходится только 50 наблюдений. Точность региональных результатов будет заметно ниже точности показателя по всей аудитории.
Если сравнение сегментов входит в основные задачи исследования, требуемый объём лучше оценить до начала сбора данных. Для проверки различий между группами может потребоваться отдельный расчёт статистической мощности, а не только расчёт погрешности общей доли.
Сколько респондентов нужно пригласить
Калькулятор показывает необходимое количество завершённых анкет. Чтобы определить число приглашений, нужно оценить, какая доля приглашённых завершит опрос.
Для предварительного планирования можно использовать формулу:
Количество приглашений = необходимое количество ответов / ожидаемая доля завершивших опрос
Если нужно получить 385 анкет:
- при ожидаемой доле завершивших 50% понадобится около 770 приглашений;
- при 25% — около 1540;
- при 10% — около 3850.
Стоит предусмотреть запас. Часть участников откроет анкету, но не дойдёт до конца. Некоторые ответы придётся исключить из-за технических ошибок, пропусков или несоответствия условиям исследования.
В профессиональной методологии показатель response rate рассчитывается сложнее и зависит от того, кого относят к приглашённым и имеющим право участвовать. Приведённая формула нужна для предварительной оценки нагрузки, а не для официального расчёта показателя отклика.
Когда результаты опроса не нужно переносить на всю аудиторию
Репрезентативная выборка нужна не каждому исследованию. Она необходима, когда результаты опроса планируется переносить на всю генеральную совокупность: например, оценивать долю довольных клиентов, измерять известность бренда или сравнивать потребительские сегменты.
Если задача состоит в сборе идей, поиске причин недовольства, проверке понятности анкеты или подробном изучении опыта отдельных людей, строгий статистический расчёт может не понадобиться.
Серия содержательных глубинных интервью способна обнаружить причины, которые не покажет закрытая анкета на тысячу человек. Но по таким интервью нельзя утверждать, что проблема встречается у определённого процента всех клиентов.
Качественное исследование помогает разобраться в причинах. Количественный опрос с подходящим дизайном оценивает распространённость явления.
Чек-лист перед запуском опроса
Перед отправкой приглашений проверьте, что на каждый вопрос в таблице есть конкретный ответ.
| Что проверить | Контрольный вопрос |
|---|---|
| Определена генеральная совокупность | Понятно ли, о каких людях будут сделаны выводы? |
| Сформулирована цель исследования | Какое решение должно быть принято по результатам опроса? |
| Продумана процедура отбора | Как представители аудитории попадут в исследование и у кого есть риск не попасть в выборку? |
| Выбрана допустимая погрешность | Соответствует ли она задаче исследования или установлена автоматически? |
| Выбран доверительный уровень | Оправдано ли выбранное значение последствиями возможной ошибки? |
| Рассчитано число завершённых анкет | Не смешивается ли количество приглашений с количеством полученных ответов? |
| Проверены отдельные сегменты | Будет ли достаточно наблюдений в каждой группе, которую планируется анализировать отдельно? |
| Учтены неответы | Будет ли проверено, отличаются ли ответившие от тех, кто проигнорировал приглашение или не завершил анкету? |
Ответы на частые вопросы
Какой размер выборки считается достаточным?
Единого значения нет. Размер выборки зависит от генеральной совокупности, допустимой погрешности, доверительного уровня, предполагаемой доли признака и задач анализа.
Почему для большой аудитории часто достаточно 385 ответов?
При доверительном уровне 95%, погрешности ±5 процентных пунктов и неизвестной доле признака расчёт для большой или неизвестной совокупности даёт 385 ответов. Это значение справедливо при предположениях, заложенных в формулу, и не гарантирует репрезентативность без корректной процедуры отбора.
Что делать, если размер генеральной совокупности неизвестен?
Выберите в калькуляторе вариант «не известен». Расчёт будет выполнен для условно бесконечной совокупности. Это даёт немного более консервативное требование к количеству ответов.
Какую долю признака указывать, если предварительных данных нет?
Используйте 50%. При таком значении неопределённость максимальна, поэтому выборка получается не меньше, чем при других предполагаемых долях, если остальные параметры остаются неизменными.
Можно ли применять рассчитанную погрешность к добровольному онлайн-опросу?
Стандартная интерпретация погрешности и доверительного интервала опирается на вероятностный отбор. Если участники сами решают, отвечать или нет, формальное достижение рассчитанного количества анкет не устраняет самоотбор и возможное систематическое смещение.
Для невероятностной выборки показатели точности могут рассчитываться в рамках отдельно описанной модели. Результат такого расчёта нельзя автоматически считать обычной ошибкой вероятностной выборки.
Нужно ли включать незавершённые анкеты в размер выборки?
Обычно учитывают завершённые и пригодные для анализа анкеты. Правила обработки частично заполненных анкет нужно определить до начала анализа и применять одинаково ко всем участникам.
Можно ли собрать больше ответов, чем показал калькулятор?
Да. При корректном отборе дополнительные ответы могут уменьшить случайную погрешность и расширить возможности анализа. Однако они не исправляют ошибки охвата, самоотбора или формулировок вопросов.
Как рассчитать выборку для сравнения регионов или клиентских сегментов?
Нужно оценить количество наблюдений не только во всей выборке, но и внутри каждой анализируемой группы. Если требуется обнаружить заданное различие между сегментами, может понадобиться расчёт статистической мощности.
Всегда ли опрос должен быть репрезентативным?
Нет. Репрезентативность нужна, когда результаты планируется переносить на всю генеральную совокупность. Для поиска идей, изучения отдельных случаев, глубинных интервью и предварительного тестирования анкеты она может не требоваться.
Попробуйте прямо сейчас
Создайте свой первый опрос бесплатно
Используйте шаблоны опросов, настраивайте дизайн, делитесь опросом на своем сайте, в соцсетях и по электронной почте. Отправляйте готовые онлайн-отчеты коллегам
1
опрос
бесплатно
50
респон-
дентов
∞
вопросов
Автор: Dr. Пол Маркс
Этот текст защищен авторским правом. Все права защищены.