Конечной целью изучения выборочной совокупности всегда является получение информации о генеральной совокупности. Для этого выборочное исследование должно удовлетворять определенным условиям. Одно из главных условий - репрезентативность (представительность) выборки . Как обсуждалось ранее, выделяют качественную и количественную репрезентативность.
Случайность, гарантирующая качественную (структурную) репрезентативность статистических исследований, достигается выполнением ряда условий формирования выборочных групп (совокупностей):
1. Каждый член генеральной совокупности должен иметь равную вероятность попасть в выборку.
2. Отбор единиц наблюдения из генеральной совокупности необходимо проводить независимо от изучаемого признака. Если отбор проводится целенаправленно, то и при этом необходимо соблюдать условия независимости распределения изучаемого признака.
3. Отбор должен проводиться из однородных групп.
Соблюдение условий, гарантирующих максимальную близость выборочной и генеральной совокупностей, обеспечивается специальными способами отбора. В зависимости от способа формирования различают следующие выборки:
1. Выборки, не требующие разделения генеральной совокупности на части (собственно, случайная повторная или бесповторная выборка).
2. Выборки, требующие разбиения генеральной совокупности на части (механическая, типическая или типологическая выборки, когортная, парно-сопряженная выборки).
Собственно, случайная выборка формируется случайным отбором - наудачу. В основе случайного отбора лежит перемешивание. Например: выбор шара в спортлото после перемешивания всех шаров, выбор выигрышных номеров лотереи, случайный выбор карточек больных для исследования и т.п. Иногда используют случайные числа, получаемые из таблиц случайных чисел или с помощью генераторов случайных чисел. Согласно этим числам из заранее пронумерованного массива генеральной совокупности выбираются единицы наблюдения с номерами, соответствующими выпавшим случайным числам.
При составлении случайной выборки после того, как объект выбран, и все необходимые данные о нем зарегистрированы, можно поступать двояко: объект можно вернуть, или не вернуть в генеральную совокупность. В соответствии с этим выборку называют повторной (объект возвращается в генеральную совокупность) или бесповторной (объект не возвращается в генеральную совокупность). Поскольку в большинстве статистических исследований разница между повторной и бесповторной выборками практически отсутствует, то априорно принимается условие, что выборка повторная.
Оценка необходимой численности выборки
Для того, чтобы выборочная совокупность была количественно репрезентативной по отношению к генеральной, необходимо первоначально оценить количество данных, которое требуется включить в выборочную совокупность.
При неизвестной величине генеральной совокупности величину повторной выборки, гарантирующую репрезентативные результаты, если результат отражается показателем в виде относительной величины (доли) , определяют по формуле:
где р – величина показателя изучаемого признака, в %; q = (100- p ) ;
t – доверительный коэффициент, показывающий, какова вероятность того, что размеры показателя не будут выходить за границы предельной ошибки (обычно берется t = 2, что обеспечивает 95% вероятность безошибочного прогноза);
- предельная ошибка показателя.
Например: одним из показателей, характеризующих здоровье рабочих промышленных предприятий, является процент не болевших в течение года работников. Предположим, что для промышленной отрасли, к которой относится обследуемое предприятие, этот показатель равен 25%. Предельная ошибка, которую можно допустить, чтобы разброс значений показателя не превышал разумные границы, 5%. При этом показатель может принимать значения 25% ±5%, т.е. от 20% до 30%. Допуская t = 2, получаем
В том случае, если показатель - средняя величина , то число наблюдений можно установить по формуле:
где σ - среднее квадратическое отклонение, которое можно получить из предыдущих исследований, либо на основании пробных (пилотажных) исследований.
При бесповторном отборе и при условии известной генеральной совокупности для определения необходимого размера случайной выборки в случае использования относительных величин (доли) применяется формула:
для средних величин используется формула:
где N - численность генеральной совокупности.
Исходя из условий приведенного выше примера и принимая численность генеральной совокупности N =500 рабочих, получаем:
Нетрудно заметить, что необходимая численность выборки при бесповторном отборе меньше, чем при повторном (соответственнo, 188 и 300 рабочих).
В целом, число наблюдений, необходимое для получения репрезентативных данных, изменяется обратно пропорционально квадрату допустимой ошибки.
Механическая выборка - выборка, когда из обследуемой совокупности единицы наблюдения отбираются механически. Например: отбор каждого пятого или каждого десятого рабочего по карточкам отдела кадров предприятия или по амбулаторным картам поликлиники МСЧ.
Типическая, типологическая или районированная выборка предполагает разбивку генеральной совокупности на ряд качественно однородных групп. Например: при изучении заболеваемости студентов вуза для углубленного обследования на каждом курсе выбираются типичные по своему составу студенческие группы. Часто этот способ отбора комбинируется с другими способами. Например: территория города делится в зависимости от степени загрязнения на типичные районы, в этих районах путем случайного отбора формируются группы наблюдения.
Когортный отбор относится к целенаправленным отборам. При этом способе из генеральной совокупности отбираются лица (распределение на подгруппы при этом является неслучайным), объединенные моментом появления какого-либо признака или изучаемого воздействия, играющего существенную роль в исследовании (год рождения, начало болезни, прием препарата и т.п.).
Исследование по типу случай-контроль (СК) – тип эпидемиологического исследования, в котором распределение фактора риска сравнивается в группе пациентов с заболеванием и контрольной группе. Исследование (СК) относится к ретроспективным, поскольку исследователь, разделив пациентов на группы, по тому, есть или нет у них заболевание, выясняет у них информацию из прошлого.
Следует отдельно остановиться на использовании выборочного метода в санитарной статистике при изучении общей заболеваемости населения. Теоретические предпосылки выборочного метода были проверены в ходе специальных исследований. Так, В.С. Быховский и соавт. в 1928 году сделали параллельную обработку 132,8 тыс. карт с данными о заболеваниях сплошным методом и методом механического отбора каждой пятой карты. Анализ результатов этой обработки показал высокую репрезентативность данных выборочного исследования заболеваемости. Однако, вплоть до сегодняшнего дня, отсутствуют единые методические подходы проведения в широкой практике выборочных санитарно-статистических исследований.
4.1 Что говорится в стандарте
Раздел 8 стандарта ИСО 9001: 2000 охватывает «измерение, анализ и улучшение». Хотя формирование выборки не регулируется данным стандартом, тем не менее, в пункте 8.1, являющемся общим введением ко всему разделу, посвященному измерениям, сказано, что деятельность, связанная с измерением, анализом и улучшением (должна включать определение применимых методов, в том числе статистические методы и степень их применения). Точное измерение удовлетворенности потребителя может быть осуществлено только тогда, когда оно основано на хорошей выборке потребителей. В данной главе дан обзор методов формирования выборки, используемых для достижения этой цели.
4.2 Теория выборки
Принцип формирования выборки прост. Большинство организаций имеют большое число потребителей, но для того чтобы получить точные результаты ИУП, нет необходимости проводить исследования со всеми, достаточно сделать это для небольшой выборки, при условии, что эта выборка представляет большую группу людей. Существует несколько различных типов выборки, которые приведены на рисунке 4.1.
Рис. 4.1 Возможные выборки
4.2.1 Вероятностная и невероятностная выборки
Фундаментальное различие между выборками состоит в их принадлежности к вероятностным или невероятностным выборкам. Вероятностную выборку еще часто называют случайной выборкой, и только в отношении случайных, или вероятностных, выборок можно быть уверенными, что они лишены тенденциозности. В соответствии с определением все члены генеральной совокупности случайной выборки имеют равные шансы быть в ней представленными, и самый очевидный пример случайной выборки - это обычная лотерея. Все шары или числа, остающиеся в розыгрыше, сохраняют равные шансы быть выбранными в следующий раз. Ясно, что никакая тенденция не влияет на выбор чисел в лотерее.
4.2.2 Невероятностные выборки
4.2.2.1 Нерепрезентативные выборки
Простейшей формой выборки является нерепрезентативная выборка. Представьте, что вы проводите опрос общественного мнения. Вы можете пойти на улицу и опросить первых встретившихся вам 50 человек, насколько они удовлетворены действиями правительства. Это будет быстро, просто и дешево, но это будет не слишком репрезентативно. Это может звучать тривиально, но для явно более сложных случаев, как мы увидим дальше, очень легко скатиться к нерепрезентативной выборке.
4.2.2.2 Преднамеренные выборки
Еще одной формой невероятностной выборки является преднамеренная выборка. Это та самая форма, которую мы предлагали для поискового исследования, и, хотя преднамеренная выборка хороша для качественного исследования, не имеющего целью достижение хорошей статистики, она не подходит для проведения основного, так же как любого другого исследования, ставящего своей целью получение статистически надежного результата.
4.2.2.3 Выборка на основании квот
Третий тип невероятностной выборки - это выборка на основании квот, и она часто используется для исследования больших генеральных совокупностей. Представьте себе, что муниципальный совет желает измерить степень удовлетворенности населения теми услугами и службами, которые этот совет им предоставляет. Предположим, что решено взять интервью на улице у членов выборки на основании квот, состоящей из 500 человек, проживающих в городе. Можно назначить пять интервьюеров, дав задание каждому взять интервью у 100 человек на главной торговой площади. Однако интервьюерам не разрешается пользоваться иереарезентативной выборкой, т.е. брать интервью у первых встретившихся им 100 человек. При выборке на основании квот необходимо, чтобы каждый интервьюер соблюдал множество тщательно определенных норм, чтобы выборка была репрезентативной для местного населения. Нормы могут быть основаны на статистических данных, имеющихся в распоряжении муниципального совета и показывающих, на какие группы делится население. Так, например, эти данные могут свидетельствовать, что 15 % составляет население в возрасте от 21 до 30 лет, 18 % - от 31 до 40 лет и т. п. Разделение может быть и по другим признакам, например, по полу, уровню доходов, этническому происхождению. Если муниципальный совет хочет, чтобы выборка была репрезентативной, в ней должны быть представлены все эти группы в той же пропорции, в какой они представлены во всем населении. Для достижения этого интервьюеры должны определить группы и квоты для них. В приведенном примере 15 из каждых 100 интервьюируемых человек должны быть в возрасте от 21 до 30 лет, 18 должны иметь возраст от 31 до 40 лет, и это должно сочетаться с квотами для других групп, введенных по полу, доходу и т. п.
Предположим, что интервьюеры работали всю неделю, с понедельника по пятницу, с 9-ти утра и до 5-ти вечера каждый день брали интервью в торговом пассаже, так что к концу недели каждый из них взял 100 интервью при соблюдении всех норм. На выходе получится выборка, размером 500, которая будет полностью представлять население города, но она будет отобрана не случайно, поэтому она не будет свободна от тенденции. В соответствии с определением случайной выборки, все жители города должны иметь равные шансы быть представленными в выборке. В приведенном примере только те люди имели такой шанс, которые в эти дни недели посещали торговый пассаж с 9-ти утра до 5-ти вечера. Таким образом, выборка неизбежно будет иметь тенденцию, возможно, в сторону пожилых людей, безработных, а также людей, работающих неподалеку. На самом деле, конечно, исследователи стремятся минимизировать тенденции, присущие выборке на основании квот, беря интервью в различных местах и в различное время, но они никогда не смогут полностью от нее избавиться, поскольку в выборке могут быть представлены только те люди, которые в данное время оказались в данном месте, поэтому теоретически такая выборка никогда не будет случайной, полностью свободной от тенденции.
Это не означает, что выборка на основании квот никогда не должна использоваться. Если вы не знаете людей, являющихся вашими потребителями, вы не можете осуществить случайную выборку, поскольку нет возможности составить список всей генеральной совокупности, из которой ее нужно делать. Например, многие розничные торговцы не знают, кто является их потребителями. В таких ситуациях организации прибегают к выборке на основании квот.
4.2.3 Вероятностные выборки
Если у вас имеется база данных ваших потребителей, то вы можете и должны сделать случайную выборку, и первый шаг состоит в определении ее основы. Основа - это список потребителей, из которого вы собираетесь делать выборку, и определение этого списка является стратегическим решением. Обычно организации измеряют удовлетворенность потребителей один раз в год, и основу выборки составляют те потребители, которые имели дело с организацией за последние двенадцать месяцев. Однако не для всех это может оказаться приемлемым. Например, не слишком эффективно при изучении удовлетворенности потребителя справочной системой какой-либо информационной технологии задавать вопросы об опыте использования этой системы за последние 11 месяцев. В таком случае лучше использовать более короткие временные рамки, например, учитывать всех потребителей, пользовавшихся справочной системой за последний месяц. Для этого может потребоваться постоянный контроль, при котором опрос потребителей проводится каждый месяц, а его результаты накапливаются для составления периодического отчета, например, ежеквартального или даже ежегодного, если количество потребителей в течение квартала невелико.
Таким образом, вы видите, что исследуемые "потребители" могут быть различными для различных организаций, и их определение является стратегическим решением, и вы должны четко их определить, ибо это будут те потребители, которые будут составлять основу исследования, т. е. генеральную совокупность выборки.
4.2.3.1 Простая случайная выборка
Вероятностная, или случайная, выборка лишена тенденции, поскольку все члены генеральной совокупности будут иметь равные шансы войти в выборку. Как было сказано ранее, лотерея дает хороший пример простой случайной выборки - каждый раз при выборе нового числа, оно отбирается случайно из всех оставшихся в «генеральной совокупности». Однако это довольно долгий процесс, если вам требуется большая выборка из большой генеральной совокупности, поэтому во времена, предшествовавшие применению компьютеров для получения сложных выборок, исследователи рынка изобрели менее трудоемкий способ получения простой случайной выборки, известной под названием «систематической случайной выборки».
4.2.3.2 Систематическая случайная выборка
Для получения систематической случайной выборки для проведения ИУП вы, прежде всего, распечатываете список ваших потребителей. Пусть там будет, скажем, 1000 потребителей, и вы хотите отобрать 100, что будет составлять 1 на 10 человек из генеральной совокупности. Сначала нужно с помощью генератора случайных чисел получить число от 1 до 10. Если получится 7, то вы включаете в свой список 7-е имя из списка, 17-е, 27-е и т.д., что в результате даст систематическую случайную выборку в 100 потребителей. До получения случайного числа все потребители имеют равные шансы быть включенными в список. Таким образом, это будет случайная выборка, но она может оказаться не репрезентативной, особенно на деловом рынке. В этом случае хорошо использовать стратифицированную случайную выборку.
Рис. 4.2 Пример стратифицированной случайной выборки
4.3 Выборка потребителей
Мы покажем на примере, как можно было бы осуществить выборку для типичного случая рынка business- to - business . Первый шаг для этого делового рынка состоит в формировании базы данных потребителей и сортировке ее по степени ценности потребителей, начиная с более высокой с постепенным переходом к наиболее низкой. Затем вы обычно делите полученный перечень на три части - сегменты, соответственно, с высокой, средней и низкой ценностью потребителей. И, наконец, определяете величину выборки в каждом сегменте. Результаты такого процесса суммированы на рис. 4.2.
4.2.3.3 Стратифицированная случайная выборка
Нередко на деловых рынках некоторые потребители являются гораздо более ценными, чем другие. Иногда очень большая часть деятельности компании, например 40 или 50 %, бывает связана с первыми пятью или шестью потребителями. Если применяется простая или систематическая случайная выборка, то вполне вероятно, что ни один из этих пяти или шести потребителей в нее не попадет. Ясно, что нет смысла проводить исследование с измерением удовлетворенности потребителя, если полностью игнорируется 40 или 50 % всей деятельности компании. На деловом рынке, где большинство компаний имеют небольшое число высокоценных потребителей и большее число малоценных потребителей, в простой или систематической случайной выборке неизбежно будут преобладать малоценные потребители. Для получения выборки, которая одновременно является репрезентативной и лишенной тенденции, применяется стратифицированная случайная выборка. Получение стратифицированной случайной выборки включает в себя, во-первых, разделение потребителей на сегменты, или типы, а затем - случайную выборку внутри каждого сегмента. Показанная на рисунке 4.2 выборка будет репрезентативной для потребительской базы в соответствии с тем вкладом в деловую активность, который дает каждый сегмент потребителей. На потребительских рынках разделение на сегменты может быть другим, например по возрасту или полу.
4.3.1 Пример выборки
В показанном примере компания получает 40 % своего оборота от высокоценных потребителей. Фундаментальный принцип выборки на деловом рынке заключается в том, что если сегмент ценных потребителей дает 40 % оборота (или прибыли) они должны составлять 40% и в выборке. Если компания решила исследовать выборку из 200 респондентов, 40% от выборки, т. е. 80 респондентов, должны быть от высокоценных потребителей. Поскольку там имеется 40 высокоценных потребителей, отбираемая доля будет 2: 1, значит, от каждого потребителя отбирается 2 респондента в высокоценном сегменте. На деловых рынках общепринято при проведении исследований отбирать более одного респондента от крупных потребителей.
Потребители средней ценности также дают 40 % оборота, так что они также должны составлять 40% в выборке. Это означает, что компания должна отобрать 80 респондентов от своих потребителей средней ценности. Поскольку таких потребителей насчитывается 160, отбираемая доля будет 1: 2, т. е. один респондент от каждых двух потребителей средней ценности. Это приводит к необходимости проведения случайной выборки одного представителя от каждых двух потребителей. Это может быть легко проведено с помощью процедуры систематической случайной выборки, описанной ранее. Сначала генерируется одно из двух случайных чисел: 1 или 2. Пусть это будет 2. В этом случае вы отбираете 2-го, 4-го, 6-го и т.д. потребителя средней ценности.
Наконец, 20 % оборота компании приходится на потребителей низкой ценности, таким образом, они должны составлять 20 % в выборке, т. е. в приведенном примере - 40 респондентов. Всего там насчитывается 400 потребителей низкой ценности, что соответствует отбираемой доле 1:10. Это может быть реализовано с применением той же продедуры систематической случайной выборки. По окончании процесса компания получит типизированную случайную выборку потребителей, которая будет репрезентативной для их деловой активности и благодаря случайному отбору будет свободна от тенденции.
4.3.2 Выборка контактных лиц
Хотя описанная выше процедура дает случайную и репрезентативную выборку потребителей, в конце концов, исследование проводится не с компаниями, а с конкретными лицами, так что если вы работаете на business - to - business рынке, вы должны, наряду с выборками потребителей, делать выборку среди личных контактов. На практике организации часто выбирают лиц по принципу удобства - людей, с которыми они имеют больше контактов, чьи имена у них есть под рукой. Если лица будут отбираться по такому принципу, то как бы тщательно не проводилась типизированная выборка компаний, в результате она будет низведена до нереггрезентативной выборки лиц, которых кто-то знает. Чтобы избежать появления подобной тенденции, вы должны проводить случайный отбор лиц. Путь к реализации такого отбора лежит в составлении списка лиц, связанных с вашей продукцией или услугой для каждого потребителя, и затем в случайном отборе лиц из этого списка. Если вы хотите осуществить более сложную и более точную процедуру, вы должны разделить список всех лиц на секторы, что позволит избежать включения слишком большого числа второстепенных лиц. Пусть, например, вы проводите анализ деятельности администрации и решили, что для более точного отражения процесса принятия решения, ваша выборка должна содержать 40% контактов по закупкам, 40% технических контактов и 20 % всех остальных контактов. В этом случае вы должны провести случайную выборку лиц в данной пропорции.
4.4 Размер выборки
Другой вопрос, требующий решения, - количество потребителей, которое вам необходимо иметь в выборке. Некоторые компании, преимущественно на business - to - business рынках, имеют очень небольшое число ценных потребителей. Другие компании имеют более миллиона потребителей. На деловых рынках размер генеральной совокупности в точности соответствует количеству лиц у каждого потребителя, влияющих на суждение о удовлетворенности этого потребителя, и это не обязательно равно количеству лиц, с которыми вы постоянно контактируете. Обычно, чем выше ценность потребителя, тем больше лиц должно быть включено. Для поставщика программного обеспечения компьютеров у одного потребителя может быть несколько сотен пользователей. Даже в этом случае некоторые организации будут иметь гораздо большую генеральную совокупность, чем другие, однако это не будет влиять на количество исследуемых потребителей, которое необходимо для обеспечения надежной выборки.
4.4.1 Надежность выборки в связи с ее размером
Статистическая точность выборки связана с ее абсолютным размером, независимо от того, какое количество людей имеется во всей генеральной совокупности. Вопрос о том, какая часть потребителей должна быть исследована - неверно поставленный вопрос. Выборка большего размера всегда более надежна, чем меньшая выборка, каким бы ни был размер генеральной совокупности. Лучше всего это видно из кривой нормального распределения (см. рис. 4.3), из которой можно заключить, что когда мы исследуем множество данных, оно стремится следовать нормальному распределению. Это применимо не только к данным исследований.
Экстремальные данные Нормальные данные Экстремальные данные
Рис. 4.3 Кривая нормального распределения
Например, если вы записываете выпадение июньских дождей в Манчестере в течение пяти лет, когда три года выпадали нормальные для июня дожди, но два года июнь был чрезвычайно дождливым, то расчетное среднее выпадение дождей будет сильно смещено за счет этих двух не по сезону дождливых месяцев. Если же данные собирались в течение 100 лет, то два исключительно дождливых или сухих месяца будут слабо влиять на результат расчета среднего количества дождей в июне в Манчестере. То же самое относится к исследованию. Если вы исследуете только 10 человек, и два из них имеют крайние точки зрения, они сильно исказят конечный результат. Они окажут гораздо меньше влияния при размере выборки в 50 и практически не окажут никакого влияния при размере выборки 500, так что чем больше размер выборки, тем меньше риск получения неверных результатов. На рисунке 4.4 показано, что при возрастании размера выборки возрастает и ее надежность. Сначала, при очень малых размерах, надежность растет очень быстро, но с ростом размера выборки влияние ее размера на надежность выборки уменьшается. Вы можете видеть, что кривая начинает выравниваться в зоне от 30 до 50 респондентов, и это обычно считается порогом между качественными и количественными исследованиями. Когда размер выборки достигает 200, увеличение надежности с ростом количества респондентов чрезвычайно мало. Соответственно, размер выборки в 200 респондентов считается минимальным размером выборки для обеспечения надежного ИУП. Компании с очень малой потребительской базой (около или менее 200 контактов) должны просто исследовать всех переписанных потребителей.
В какие-то годы, возможно, в июне не было дождей (даже в Манчестере), в некоторые годы интенсивность дождей была невероятно высока, но в большинстве лет выпадение дождей лежит где-то между этими двумя пределами, в «нормальной» зоне. Рассматриваем ли мы данные исследований или выпадение дождей в Манчестере, ключевой вопрос состоит в следующем: «Каков риск получения ненормальных данных, искажающих результат?» Чем меньше выборка, тем выше риск.
4.4.2 Глубинный анализ
Как отмечалось ранее, при проведении коммерческих исследований обычно полагается, что выборка размером в 200 членов дает необходимую надежность общей меры удовлетворенности потребителя, независимо от того, составляет ли генеральная совокупность 500 или 600 ООО. Здесь, однако, есть одно важное исключение, и оно проявляется в том случае, когда у вас имеются различные сегменты, и вы хотите провести глубинный анализ результатов, сравнивая удовлетворенности в различных сегментах. Если вы разделите выборку в 200 элементов на множество сегментов, вы столкнетесь с проблемой малого и поэтому ненадежного размера выборки в каждом сегменте. Поэтому общепринятым считается, что минимальный размер общей выборки составляет 200, а минимум для сегмента равен 50.
Вследствие всего сказанного размер общей выборки часто определяется тем, какое количество сегментов вы хотите проанализировать. Если вы хотите разделить ваш результат на шесть сегментов, вам понадобится выборка размером не менее 300 членов, чтобы в каждом сегменте их было не менее 50. Это может иметь большое значение для компаний со многими подразделениями или рынками сбыта. Исходя из цифры в 50 респондентов на сегмент, розничному торговцу, имеющему 100 магазинов, потребуется выборка, как минимум, в 5000 членов, если удовлетворенность потребителя требуется измерить на уровне магазина. По нашему мнению, однако, если между магазинами должно проводиться сравнение, и на основании результатов исследования будет приниматься управленческое решение, то абсолютный минимум должен быть 100 потребителей на магазин, а еще лучше - 200. Для розничного торговца, имеющего 100 магазинов, это приведет к необходимости выборки в 20 000 потребителей для получения очень надежных результатов на уровне магазина.
4.4.3 Размер выборки и процент ответов
Необходимо отметить еще один фактор. Рекомендованный размер пыборки в 200 респондентов для обеспечения соответствующей надежности относится к ответам, а не к числу отобранных и приглашенных потребителей. Более того, для обеспечения статистической надежности, это означает 200 отобранных потребителей и те же 200 участников, ответивших на вопросы интервью или вернувших анкеты. Если процент ответов низок, то статистически ненадежно компенсировать его простой рассылкой большего количества анкет до тех пор, пока вы не получите 200 ответов. Проблема тенденции, вызванной недостатком ответов, может быть очень существенной при исследованиях ИУП, и эта проблема будет более детально рассмотрена в следующей главе.
4.5 Выводы
(а) В стандарте ИСО 9000: 2000 говорится, что для получения надежной выборки при проведении измерений, связанных с потребителем, должны применяться признанные статистические методы.
(б) Невероятностные выборки увеличивают риск влияния тенденции на получаемый результат и должны применяться только теми организациями, у которых отсутствует база данных потребителей.
(в) Для большинства организаций лучшим способом получения репрезентативной и лишенной тенденции выборки является случайная выборка на основании квот.
(г) Основу выборки должны составлять значимые лица. На деловых рынках может потребоваться включать много респондентов (иногда - очень много) от крупных потребителей.
(д) 200 респондентов составляют минимальное число респондентов, необходимое для надежного измерения удовлетворенности потребителя в масштабе целой организации. Это число не зависит от количества имеющихся у вас потребителей.
(е) Организации, имеющие менее 200 потребителей или контактов, должны проводить исследование всех переписанных потребителей.
(ж) Если необходимо получить результаты по сегментам, то минимальный размер выборки на сегмент составляет 50 респондентов. В этих случаях, требуемый минимальный размер всей выборки будет равен числу сегментов, умноженному на 50.
Репрезентативность выборки
Наименование параметра | Значение |
Тема статьи: | Репрезентативность выборки |
Рубрика (тематическая категория) | Психология |
Требования к выборке
К выборке применяется ряд обязательных требований, определенных, прежде всего, целями и задачами исследования. Планирование эксперимента должно включать в себя учет, как объёма выборки, так и ряда ее особенностей. Так, в психологических исследованиях важно требование однородности выборки. Оно означает, что психолог, изучая, к примеру, подростков, не может, включать в эту же выборку взрослых людей. Напротив, исследование, выполненное методом возрастных срезов, принципиально предполагает наличие разновозрастных испытуемых. При этом и в данном случае должна соблюдаться однородность выборки, но уже по другим критериям, в первую очередь таким, как возраст, пол. Основаниями для формирования однородной выборки могут служить разные характеристики, такие, как уровень интеллекта͵ национальность, отсутствие определенных заболеваний и т.д., исходя из целей исследования.
В общей статистике имеется понятие повторной и безповторной выборки, или, иначе говоря, выборки с возвратом и без возврата. В качестве примера приводится, как правило, выбор шара, доставаемого из какой-либо емкости. В случае выборки с возвратом каждый выбранный шар опять возвращается в емкость и, следовательно, должна быть выбран снова. При бесповторном выборе однажды выбранный шар откладывается в сторону и больше не может участвовать в выборке. В психологических исследованиях можно найти аналоги подобного рода способам организации выборочного исследования, поскольку психологу нередко приходится несколько раз тестировать одних и тех же испытуемых при помощи одной и той же методики. При этом, строго говоря, повторной в данном случае является процедура тестирования. Выборка испытуемых при полной тождественности состава в случае повторных исследований всегда будет иметь некоторые отличия, обусловленные функциональной и возрастной изменчивостью, присущей всем людям. Подобная выборка по характеру проведения процедуры является повторной, хотя смысл термина здесь, очевидно, иной, чем в случае с шарами.
Важно подчеркнуть, что все требования, предъявляемые к любой выборке, сводятся к тому, что на ее базе психологом должна быть получена наиболее полная, неискаженная информация об особенностях генеральной совокупности, из которой взята эта выборка. Иными словами, выборка должна как можно более полно отражать характеристики изучаемой генеральной совокупности.
Состав экспериментальной выборки должен представлять (моделировать) генеральную совокупность, поскольку выводы, полученные в эксперименте, предполагается в дальнейшем перенести на всю генеральную совокупность. По этой причине выборка должна обладать особым качеством - репрезентативностью, позволяющим распространить полученные на ней выводы на всю генеральную совокупность.
Репрезентативность выборки очень важна, тем не менее, по объективным причинам соблюдать её крайне сложно. Так, хорошо известен факт, что от 70% до 90% всех психологических исследований поведения человека проводились в США в 60-х годах XX века с испытуемыми-студентами колледжей, причем большинство из них были студентами психологами. В лабораторных исследованиях, выполняемых на животных, наиболее распространенным объектом изучения являются крысы. По этой причине неслучайно психологию называли раньше ʼʼнаукой о студентах-второкурсниках и белых крысахʼʼ. Студенты психологических колледжей составляют всего 3% от общей численности населения США. Очевидно, что выборка студентов нерепрезентативна в качестве модели, претендующей на представительство всего населения страны.
Репрезентативная выборка, или, как еще говорят, представительная выборка, - это такая выборка, в которой все основные признаки генеральной совокупности представлены приблизительно в той же пропорции и с той же частотой, с которой данный признак выступает в данной генеральной совокупности. Иными словами, репрезентативная выборка представляет собой меньшую по размеру, но точную модель той генеральной совокупности, которую она должна отражать. В той степени, в какой выборка является репрезентативной, выводы, основанные на изучении этой выборки, можно с большой долей уверенности считать применимыми ко всей генеральной совокупности. Это распространение результатов принято называть генерализуемостью.
В идеале репрезентативная выборка должна быть такой, чтобы каждая из базовых изучаемых психологом характеристик, черт, особенностей личности и т.п. была бы представлена в ней пропорционально этим же особенностям в генеральной совокупности. Согласно этим требованиям процедура формирования выборки должна иметь внутреннюю логику, способную убедить исследователя, что при сравнении с генеральной совокупностью она действительно окажется репрезентативной, представительной.
В своей конкретной деятельности психолог действует следующим образом: устанавливает подгруппу (выборку) внутри генеральной совокупности, подробно изучает эту выборку (проводит с ней экспериментальную работу), а затем, в случае если это позволяют результаты статистического анализа, распространяет полученные выводы на всю генеральную совокупность. Это и есть основные этапы работы психолога с выборкой.
Начинающий психолог должен иметь в виду часто повторяющуюся ошибку: каждый раз, когда он осуществляет сбор любых данных любым методом и из любого источника, у него всегда появляется соблазн распространить свои выводы на всю генеральную совокупность. Для того чтобы избежать подобной ошибки, нужно не просто обладать здравым смыслом, но, прежде всего, хорошо владеть основными понятиями математической статистики.
Репрезентативность выборки - понятие и виды. Классификация и особенности категории "Репрезентативность выборки" 2017, 2018.
Выборка— это множество данных, взятых с помощью определённых процедур из генеральной совокупности для исследовательского анализа. Репрезентативность - это свойство воспроизведения представления о целом по его части. По иному, это возможность распространения представления о части на целое, которое эту часть включает в себя.
Репрезентативность выборки — это показатель, заключающийся в том, что выборка должна полно и достоверно отображать признаки той совокупности, частью которой она является. Её также можно определять как свойство выборки наиболее полно представлять характеристики генеральной совокупности, существенные с точки зрения цели исследования.
Допустим, что генеральная совокупность — все ученики школы (900 человек из 30 классов, по 30 человек в каждом классе). Объект исследования — отношение школьников к курению. Выборочная совокупность, состоящая из 90 учащихся только намного хуже представит всю совокупность, чем выборка из тех же 90 учеников, куда вошли бы из каждого класса по 3 ученика. Главная причина — неравное распределение по возрастам. Таким образом, в первом случае репрезентативность выборки будет низкой. Во втором случае - высокой.
В социологии говорят, что существует репрезентативность выборки и её нерепрезентативность.
В качестве примера нерепрезентативной выборки можно привести классический случай, произошедший в 1936 году в США во время президентских выборов.
Журнал «Литэрари дайджест», который до этого весьма успешно прогнозировал результаты предыдущих выборов, на этот раз ошибся в своих прогнозах, хотя разослал несколько миллионов письменных вопросов подписчикам, а также респондентам, которых они выбрали из телефонных книг и из списков регистрации автомобилей. В 1/4 бюллетеней, которые вернулись заполненные обратно, голоса распределились следующим образом: 57 % отдали первенство кандидату от республиканцев по имени Альф Лэндон, а 41 % отдали предпочтение действующему президенту - демократу Франклину Рузвельту.
В действительности, на выборах победил Ф. Рузвельт, который набрал почти 60 % голосов. Ошибка «Литэрари дайджест» была в следующем. Они захотели увеличить репрезентативность выборки. А так как они знали, что большинство их подписчиков относят себя к республиканцам, то они решили расширить выборку за счёт респондентов, выбранных ими из телефонных книг и автомобильных регистрационных списков. Но они не учли существующих реалий и фактически отобрали ещё больше сторонников республиканцев, потому что во времена иметь автомобили и телефоны мог позволить себе средний и высший класс. А это и были по большей части республиканцы, а не демократы.
Существуют различные виды выборки: простая случайная, серийная, типическая, механическая и комбинированная.
Простая случайная выборка состоит в отборе из всей совокупности изучаемых единиц наугад без какой-либо системы.
Механическую выборку применяют тогда, когда в генеральной совокупности есть упорядоченность, например, имеется некая последовательность единиц работников, избирательные списки, номера телефонов респондентов, номера квартир и домов и другое).
Типический отбор используется тогда, когда всю совокупность можно разделить на группы по типам. При работе с населением такими могут быть, например, образовательные, возрастные, социальные группы, при исследовании предприятий - отрасль или отдельная организация и др.
Серийный отбор удобен тогда, когда единицы объединены в небольшие серии или группы. Такой серией могут быть партии готовой продукции, школьные классы, и другие группы.
Комбинированная выборка предполагает использование всех предыдущих видов выборки в той или иной комбинации.
Это означает,что если вы, опросив, предположим, 400 человек в районном городе, где численность взрослого платежеспособного населения составляет 100 тыс. человек, выявили, что 33% опрошенных покупателей предпочитают продукцию местного мясокомбината, то с 95%-ной 39 вероятностью можете утверждать, что постоянными покупателями этой продукции являются 33+5% (т.е. от 28 до 38%) жителей этого города.
Можно также воспользоваться расчетами института Гэллапа для оценки соотношения размеров выборки и ошибки выборки (см. выше).
Сегодня многие трудные расчеты берет на себя техника, а статистические программы можно получить по Интернету. Вот и с расчетом выборки ленивому социологу предоставили такую возмож-
ность на веб-сайте Аналитического центра «Бизнес и маркетинг» (http://www.bma.ru/enter.htm), где пользователю надо лишь внести необходимые данные, а затем нажать на кнопку «Рассчитать».
Контроль и ремонт выборки
Качество социологической информации может снизить множество факторов: неправильно сформулированные анкетные вопросы, не так выбранный метод исследования, пропущенные ответы в анкетах, нечетко спланированная выборка и др.
Практика эмпирических исследований - зарубежных и отечественных, фундаментальных и прикладных - свидетельствует, что ошибки, в том числе при составлении выборки, встречаются почти в каждом исследовании. Другой вопрос - значимые или незначимые смещения такого рода. А поскольку ошибки, накладки и смещения происходят всегда, то для специалистов, занятых контролем и ремонтом выборки, работа всегда найдется. Да и саму эту область методической науки преждевременная старость не ожидает. Не только в науке, но и в любой другой сфере профессия контролеров и ремонтников всегда была хлебной и престижной.
Контролем выборки будем называть процесс научного сравнения генеральной и выборочной совокупностей, выявление степени их расхождения, обнаружение причин отклонения и разработку возможных способов устранения погрешностей. В узком смысле - это уравнивание выборочных и генеральных распределений социально-демографических характеристик респондентов.
Под ремонтам выборки надо понимать сам процесс устранения погрешностей, т.е. расхождения двух совокупностей, теми способами, методами и инструментами, которые предлагает методическая наука.
Таким образом, второй прием выступает практической реализацией первого, аналитического, а оба они составляют два обязательных этапа проведения социологического исследования.
Часто контроль выборки употребляют в расширенном значении, включая в него также ремонт выборки. В этом случае говорят о широком понимании ремонта выборки как первичной статистической обработки данных, включающей коррекцию: а) выборочной совокупности; б) распределений социально-демографических характеристик респондентов; в) резко выделяющихся и пропущенных ответов, а также взвешивание исходных данных. Указанные виды коррекции призваны отремонтировать самое главное - выборку исследования, повысить степень ее репрезентативности. Почему это главное? Анкета может быть исключительно интересной, глубокой
Основная цель ремонта выборки - повышение качества уже собранной информации. Процедура ремонта выборки включает несколько операций 40 .
Коррекция выборочной совокупности. Далеко не всегда отобранные респонденты, по самым разным обстоятельствам, могут или желают отвечать на вопросы. Кто-то заболел или уехал в срочную командировку, другой отказывается по идейным соображениям или не способен отвечать в силу умственной недостаточности. Кого-то трудно застать дома, хотя анкетер приходил к нему не единожды.
Возникает проблема замены респондентов, которая может быть решена с помощью нескольких методов: выбор следующего по списку респондента (например, следующего номера в телефонном справочнике), использование первоначальной выборки больших размеров и формирование повторной выборки. В последнем случае, если процент ответов оказался намного ниже, чем ожидалось, основа выборки расширяется за счет дополнительных имен, найденных, например, случайным образом. Самым эффективным способом считается поиск эквивалентной замены. Если, к примеру, в вашу выборку попал работающий пенсионер такой-то национальности и овдовевший, то желательно подыскать ему в качестве замены другого пенсионера сходного возраста, национальности, овдовевшего и работающего. Нередко подобный способ превращается в трудо- и времязатратное мероприятие. Если список генеральной совокупности невелик и найти замену не удается, следует отказаться от эквивалентного метода и перейти к другому.
Коррекция распределений демографических характеристик респондентов. Если по окончании исследования в паспортичке вашего исследования получилось, что у вас, к примеру, перебор женщин, людей с высшим образованием или пожилых людей в сравнении с теми процентными долями, которые они имеют в генеральной совокупности, то можно применить три способа: 1) удалить те группы респондентов, которые оказались представлены в избыточном количестве; 2) доопросить те группы, которые оказались представ-
ленными в недостаточном количестве; 3) математически повысить значение ответов, представленных недостаточно, или снизить - представленных избыточно. Но сначала желательно выяснить, а влияет ли то и другое на содержание ответов. Может быть, все можно оставить и так.
Взвешивание исходных данных - математический способ повышения или понижения значения ответов конкретной группы респондентов (например, незамужних сельских женщин в возрасте от 30 до 45 лет). Взвешивание означает присваивание каждому респонденту определенного веса (коэффициента, на который нужно умножить все мнения-ответы одного или группы респондентов ради восстановления репрезентативности). По мнению А. Балабанова 41 , взвешивание - единственный способ восстановления репрезентативности в панельных исследованиях без потери точности. Поскольку способов взвешивания существует очень много, то перед социологом возникают достаточно непростые методологические проблемы, которые без соответствующей подготовки и знаний решить невозможно. Весовые коэффициенты можно определять по-разному, а сам процесс присвоения коэффициентов почти невозможно контролировать со стороны, другим исследователям. Самый простой способ - численность конкретной социально-демографической группы, например подростков от 13 до 17 лет, из генеральной совокупности (N) делят на количество респондентов, представляющих данную возрастную группу (п), полагая, что один респондент представляет мнение jVчеловек генеральной совокупности.
Сотрудники Института социологии АН СССР А.А. Давыдов и А. О. Крыштановский в свое время установили любопытные факты 42 . Оказывается, демофафические признаки респондентов почти никак не связаны с ответами об удовлетворенности работой и жизнью, оценкой темпов перестройки, одобрением деятельности политических лидеров, оценкой внешнеполитических событий и т.д. Другими словами, мужчины и женщины одинаково отвечают на вопросы об удовлетворенности жизнью или о политических событиях. Для этих индикаторов перевзвешивание проводить не нужно. Если же одна характеристика, например пол, тесно связана со всеми содержательными вопросами или разные вопросы связаны с различными характеристиками, то коррекцию придется делать по схеме, описанной в пособии.
Специалисты ВЦИОМ обеспечивают при анализе данных тщательный ремонт выборки, чтобы минимизировать отклонения, возникшие на этапе полевых работ. Особенно сильные смещения наблюдаются по параметрам пола и возраста.
Коррекция резко выделяющихся ответов респондентов. При опросе иногда попадаются такие ответы респондентов, которые резко выделяются на общем фоне. Причины могут быть самые разные: респондент неправильно понял вопрос анкеты, у него оригинальные взгляды на мир или попросту решил подшутить над учеными. Могут быть и другие причины. Но вернуться к нему и переспросить уже нельзя. В таком случае, особенно если анкет много, бракованный экземпляр лучше удалить из общего массива.
Коррекция пропущенных ответов. Пропуски чаще всего возникают в открытых и табличных вопросах. Самый простой способ коррекции - исключить их или всю анкету из научного анализа. При пропуске не содержательного вопроса, а того, что. имеется в паспортичке, поступают так. Если социально-демографические характеристики не связаны с содержательными ответами, то анкете с пропущенными значениями следует присвоить наиболее часто встречающиеся в выборке социально-демографические характеристики либо определить их случайным образом или пропорционально (если таких анкет много). Если же связь есть, то следует определить, к ответам какой группы (например, мужчин или женщин) ближе ответы в анкете, где графа «пол» не указана, и внести этот признак 44 .
Если данных получено много, то ремонт выборки может осуществляться за счет сокращения выборочной совокупности. Это, по мнению А.А. Давыдова и А.О.Крыштановского, наиболее рациональный подход к ремонту выборки, поскольку данная стратегия не опирается ни на какие дополнительные допущения. Если объем выборки незначителен, то для ее ремонта нужно принимать ряд дополнительных допущений, которые не следуют из собранного материала и истинность которых трудно проверить.
Переформирование выборки осуществляется тогда, когда проверка показала, что выборка не представляет совокупность в целом. В этом случае выбираются новые респонденты, и они добавляются к ранее использованной выборке, пока не достигается удовлетворительный уровень репрезентативности.
Далеко не все социологи, организующие эмпирическое исследование, включают данные о контроле и ремонте выборки в его «паспортичку». Так, среди 300 исследований, содержавшихся в Банке данных ИС АН СССР на 1988 г., лишь в десяти осуществлялся ремонт выборки 45 . Для сравнения отметим: за рубежом ремонт выборки уже давно стал распространенным методом повышения качества социологической информации.
Раньше причины отставания таились в отсутствии вычислительной техники, специализированного программного обеспечения, методических пособий, недостаточной квалификации исследователей. Сегодня есть и техника, и нужные программы, но проблема не решена. Видимо, ее нельзя свести лишь к техническим аспектам.
На практике ошибка выборки определяется путем сравнения известных характеристик генеральной совокупности с выборочными средними. В социологии при обследованиях взрослого населения чаще всего используют данные переписей населения, текущего статистического учета, предшествующих опросов на том же объекте. В качестве контрольных параметров обычно применяются социально-демографические признаки (пол, возраст, национальность, семейное положение). Поскольку сравнение своих и чужих данных можно сделать по завершении исследования, такой способ контроля называется апостериорным, т.е. осуществляемым после опыта.
Например, институт Дж. Гэллапа, использующий выборки объемом 1500 чел., контролирует репрезентативность по имеющимся в национальных цензах данным о распределении населения по полу, возрасту, образованию, доходу, профессии, расовой принадлежности (белый - цветной), месту проживания, величине населенного пункта 46 . В исследованиях, проводимых ВЦИОМ, надежность выборочных данных определяется методом апостериорного контроля. В анкету мониторинга обязательно включают несколько вопросов, по которым имеется надежная информация в Госкомстате РФ. К ним обычно относятся пол, возраст, образование, тип поселения, семейное положение, сфера занятости, должностной статус респондента. Четыре показателя - пол, возраст, образование и место жительства респондента используются для выделения контролируемых групп при определении весов
опрошенных - они должны соответствовать аналогичным группам в генеральной совокупности 47 . Поскольку из официальной статистики известно, сколько в России мужчин и женщин, то легко сравнить по этим цифрам данные мониторинга и определить погрешность.
В обследованиях Центра «Социо-Экспресс» Института социологии РАН репрезентативность всероссийской выборки (проектный объем 2 тыс. чел.) контролируется по региональным пропорциям численности населения, пропорциям между городским и сельским населением, пропорциям между населением указанных типов населенных пунктов. Опрос производится методом формализованного интервью по месту жительства. В основе размещения выборки лежат десять экономико-географических зон, в каждой из которых выделяются крупные города (численностью свыше 500 тыс. населения), средние города (50-500 тыс.), малые города (до 50 тыс.) или поселки городского типа, а также сельские населенные пункты. Авторы полагают, что предельная ошибка их выборки не превышает 3% 48 .
Эффективным контролем выборки и вообще качества данных в исследовании служит публикация ключевых характеристик исследования, прежде всего методического инструментария. Если автор исследования скрывает информацию, указывая на коммерческую тайну, то обязательно должно возникнуть подозрение в его нечистоплотности. Как справедливо замечает А. Балабанов, все методики измерений, даже в сфере маркетинговых исследований и масс-медиа, давно известны, они абсолютно открыты и не могут являться объектом коммерческой тайны. Более того, отсутствие данных о методике измерений является нарушением всех имеющихся в мире соглашений, в частности о медиаизмерениях 49 .
Паспортичка выборки
При написании научного отчета и публикации статьи в академическом журнале от авторов исследования всегда требуют четких разъяснений относительно самого исследования и выбороч-
ной совокупности: кто и когда проводил исследование, какие методы исследования использовались, каковы тип, объем и характер выборки, ошибка репрезентативности, состав выборочной совокупности по главным параметрам (например, пол, возраст, национальность, образование), контроль данных и др. Если эти сведения отсутствуют, то статью в журнал обычно не принимают, а если они присутствуют лишь частично, то им не доверяют серьезные исследователи. Таким образом, паспортичка исследования и паспортичка выборки необходимы авторам не меньше, чем редакторам и читателям.
Паспортичка выборки появляется у социолога дважды. Первый раз характеристику типа выборки с кратким обоснованием целесообразности ее использования в соответствии с целями исследования, требованиями репрезентативности и организационными возможностями исследования социологу приходится давать в Методическом разделе программы своего исследования. Раздел о выборке содержит ответы на следующие вопросы:
♦ Каков эмпирический объект исследования?
♦ Является ли исследование сплошным или выборочным?
♦ Если оно является выборочным, то претендует ли оно на репрезентативность?
♦ Если оно претендует на репрезентативность, то какова генеральная совокупность?
♦ Сколько ступеней отбора применяется в выборке?
♦ Какова единица отбора на каждой ступени?
♦ Какая стратегия отбора применяется на каждой ступени (случайная, квотная)?
♦ Какая конкретно разновидность случайного отбора применяется?
♦ Какие параметры используются при квотной выборке?
♦ Что является основой выборки (список, картотека, карта)?
♦ Какова единица наблюдения на последней ступени отбора?
Принципы выборки описываются не только для метода опроса, но и для каждого метода, используемого в исследовании: анализ документов, наблюдение и т.д.
Условный пример описания выборки. В исследовании эффективности бригадных форм организации труда возможна такая стратегия. 1. В качестве эмпирического объекта принимаются рабочие, объединенные в бригадную форму организации труда. 2. Исследование выборочное. 3. Генеральной совокупностью выступают все рабочие, объединенные в бригадную форму. 4. Применяются три ступени отбора. 5. На первой ступени выделяются бригады, занятые в основном и вспомогательном произвол-
стве. Для последних применяется сплошной опрос (в связи с их малочисленностью), а для первых - выборочный. 6. Вторая ступень - отбор бригад, занятых в основном производстве. По показателям, характеризующим конечные результаты, бригады разделяются на три группы: а) передовые; б) средние; в) отстающие. В зависимости от числа бригад на каждую группу составляют список, и по нему делается случайный непропорциональный отбор (например, по три бригады в каждой) с помощью опреде-ленного «шага выборки». 7. Третья ступень - в отобранных бригадах проводится сплошной опрос. Единицей наблюдения выступает отдельный работник 50 .
Второй раз с описанием выборки социолог встречается уже после проведения исследования - когда пишет научный отчет или научную статью в журнал.
Неполное описание паспортных данных исследования, к сожа-лению, самая распространенная болезнь российских ученых. Не-которые не знают, как именно их составлять, другие считают та-кие сведения необязательными или неважными. А есть и такая ка-тегория исследователей, которым сообщить просто нечего, поскольку, описав все сведения о выборке, они разоблачат свою неграмотность. Распространенный случай - социолог как-то про-вел исследование, каким-то образом построил выборку и что-то там получил. Но сформулировать паспортичку, выразить на научном языке свои действия он не может.
Хроническая болезнь отечественных социологов - отсутствие или недостаточно высокая методическая культура. Она касается не только организации и проведения полевого исследования, но и публикации его результатов в открытой печати. Подобный факт известен всем и о нем переодически говорят с 1960-х по 2000-е гг. Иногда наших социологов и психологов удается, что называется, застичь на месте преступления.
Согласно данным исследования В.В. Солодникова, который провел вторичный анализ публикаций в трех академических жур- налах: «Социологические исследования», «Вопросы психологии»
и «Психологический журнал» за 1986-1992 гг., ни социологи, ни психологи не утомляют себя выдвижением, обоснованием и проверкой гипотез. Большинство ученых (от 61 % у психологов до 92% у социологов) обходится без такого познавательного инструмента, нарушая все каноны научного метода. Только в 8% социологических публикаций гипотезы формулируются в явном виде. Плохо обстоит дело у социологов и психологов с описанием объекта исследования: мало кто указывает количество опрошенных, пол и возраст респондентов, редко сообщается уровень образования опрошенных, место проживания, продолжительность семейной жизни (для состоящих в браке), доход и профессиональный статус. Проблема репрезентативности, т.е. сравнение выборочной и генеральной совокупностей по указанным признакам, почти совсем не обсуждается. Кроме того, единичны упоминания социологов о пилотаже инструментария, об использовании ранее апробированных методик. Хотя самым распространенным методом сбора эмпирической информации выступает опрос, редко кто описывает, какой именно его вид применялся в зависимости от места, времени или способа заполнения анкеты.
2.12. Репрезентативность
Репрезентативность (франц. representatif - показательный) - свойство выборочной совокупности представлять характеристики генеральной совокупности. Репрезентативность выборки означает, что с некоторой наперед заданной или вычисленной на фактической выборке погрешностью установленное на выборочной совокупности можно отождествить с генеральной совокупностью или, если использовать язык статистики, найти оценки параметров генеральной совокупности. Во-первых, каждая единица генеральной совокупности должна иметь равную вероятность попасть в выборку. Во-вторых, во избежание направленного отбора выбор единиц генеральной совокупности нужно производить независимо от изучаемого признака. В-третьих, отбор должен производиться по возможности из однородных совокупностей. В-четвертых, число единиц генеральной совокупности, отобранных для обследования, должно быть достаточно большим.
Процесс непосредственного определения репрезентативности выборки складывается из этапов: сопоставление средних показателей распределений выборочной и генеральной совокупностей; сопоставление форм распределения этих показателей. Средний показатель распределения обычно берется как средняя 144
арифметическая или средневзвешенная арифметическая этого распределения.
В случае изучения совокупностей с альтернативными признаками вместо средней арифметической вычисляется доля единиц, обладающих рассматриваемой характеристикой, относительно всей совокупности. Если обозначить объем совокупности символом N, а явление с данным признаком - М, то Р - доля явлений с этим признаком определяется:
где Q - доля явлений с альтернативным признаком.
Пользоваться выводами, полученными на основании исследо-вания выборочной совокупности, можно в том случае, если раз-ность между средними арифметическими (или средними долями)" признаков выборочной и генеральной совокупностей стремится к нулю. Предполагается, что это требование удовлетворяется при выполнении четырех условий, оговоренных выше. Правда, зная только выборочные средние показатели, нельзя дать точные оцен-ки их разности, так как неизвестны средние показатели генераль-ной совокупности. Кроме того, сами значения выборочных средних могут колебаться в зависимости от того, какие единицы генеральной совокупности попадут в выборку. Поэтому оценка репрезентативности выборочной совокупности по средним показателям ее распределения сводится к поиску ошибки репрезентативности.
Сравнение выборочной и генеральной совокупностей по средним показателям не дает полного представления о генеральной совокупности. Так, в двух совокупностях с одинаковыми средними показателями расхождения между максимальным и минимальным значением признака, определяющие форму его распределения, могут быть различны. Если представить такое распределение графически, то оно образует симметричную колоколообразную (нормальную) кривую, отражающую тот факт, что сумма многих независимых произвольно распределенных случайных переменных приближенно распределяется по нормальному закону. Ордината у, которая определяет высоту кривой для каждой точки х, представляет собой плотность вероятности для значения х г
Максимум плотности вероятности приходится на среднее значение переменной и равен единице. Это означает, что чем меньше
случайное значение переменной отличается от ее среднего значения, тем больше вероятность его проявления. И наоборот, чем больше отклонение значений переменной от ее средней величины, тем вероятность их появления меньше. Таким образом, значения отклонений от средних величин, т.е. значения вида х (- х, несут информацию о вариации изучаемых переменных. Если бы все значения признака были одинаковы и совпадали с его средней величиной, то совокупность значения этого признака была бы предельно однородной.
Обычно число положительных отклонений от среднего арифметического значения совокупности примерно равно числу отрицательных отклонений, т.е. сумма всех отклонений неизбежно стремится к нулевому значению. Поэтому, если бы потребовалось просуммировать все отклонения признака в совокупности, эта сумма всегда была бы равна нулю:
Во избежание этого каждое отклонение возводят в квадрат и находят сумму квадратов - дисперсию.
Нормальное распределение в полной мере характеризуется параметрами: jc - среднее значение признака и а - среднее квадратичное (стандартное) отклонение. Среднее х определяет положение распределения относительно оси х; стандартное отклонение показывает форму кривой; чем больше значение а, тем шире кривая и тем ниже ее максимум.
Площадь под нормальной кривой располагается таким образом, что в границах х ± о находится 68% всего распределения признака, в границах х ± 2<т - 95,5, в пределах х ± Зет - 99,7%. Вероятность того, что разность между случайной переменной, распределенной примерно по нормальному закону, и ее средним значением по абсолютной величине превосходит Зет, меньше 0,3%. Отсюда следует, что практически со стопроцентной точностью можно утверждать:
Оценка репрезентативной выборочной совокупности по форме распределения показателей представляет собой сравнение мер вариации этих показателей в выборочной и генеральной совокупностях. Дисперсия генеральной совокупности известна далеко не в сегда, однако в математической статистике доказано, что меж-
ду генеральной и выборочной дисперсиями существует соотношение вида:
где п - объем выборки.
Проблема репрезентативности выборки имеет важное значение как проблема правомерности экстраполяции выводов, полученных при анализе выборочной совокупности, на всю генеральную со-вокупность 52 .
Глава 3. ПРОГРАММА
Похожая информация.