Конкретная, средняя и предельная ошибки выборки. Выборочное наблюдение в статистике Средняя ошибка случайной выборки чем предельная

Для характеристики надежности выборочных показателей различают среднюю и предельную ошибки выборки, которые свойственны только выборочным наблюдениям. Данные показатели отражают разность между выборочными и соответствующими генеральными показателями.

Средняя ошибкавыборки определяется прежде всего объемом выборки и зависит от структуры и степени варьирования изучаемого признака.

Смысл средней ошибки выборки заключается в следующем. Рассчитанные значения выборочной доли (w) и выборочной средней ()по своей природе случайные величины. Они могут принимать различные значения в зависимости от того, какие конкретные единицы генеральной совокупности попадут в выборку. Например, если при определении среднего возраста работников предприятия в одну выборку включить больше молодежи, а в другую - работников старшего возраста, то выборочные средние и ошибки выборки будут разными. Средняя ошибка выборки определяется по формуле:

(27) или - повторная выборка. (28)

Где: μ – средняя ошибка выборки;

σ – среднее квадратическое отклонение признака в генеральной совокупности;

n – объем выборки.

Величина ошибки μ показывает, насколько среднее значение признака, установленное по выборке, отличается от истинного значения признака в генеральной совокупности.

Из формулы следует, что ошибка выборки прямо пропорциональна среднему квадратическому отклонению и обратно пропорциональна корню квадратному из числа единиц, попавших в выборку. Это означает, например, что чем больше разброс значений признака в генеральной совокупности, то есть чем больше дисперсия, тем больше должен быть объем выборки, если мы хотим доверять результатам выборочного обследования. И, наоборот, при малой дисперсии можно ограничиться небольшим числом выборочной совокупности. Ошибка выборки при этом будет находиться в приемлемых пределах.

Поскольку при бесповторном отборе численность генеральной совокупности N в ходе выборки сокращается, то в формулу для расчета средней ошибки выборки включают дополнительный множитель

(1- ). Формула средней ошибки выборки принимает следующий вид:

Средняя ошибка меньше у бесповторной выборки, что и обусловливает ее более широкое применение.

Для практических выводов нужна характеристика генеральной совокупности на основе выборочных результатов. Выборочные средние и доли распространяются на генеральную совокупность с учетом предела их возможной ошибки, причем с гарантирующим ее уровнем вероятности. Задавшись конкретным уровнем вероятности, выбирают величину нормированного отклонения и определяют предельную ошибку выборки.

Надежностью (доверительной вероятностью) оценки Х по Х* называют вероятность γ , с которой осуществляется неравенство

׀Х-Х*׀< δ, (30)

где δ – предельная ошибка выборки, характеризующая ширину интервала, в котором с вероятностью γ находится значение исследуемого параметра генеральной совокупности.

Доверительным называют интервал (Х* - δ; Х* + δ), который покрывает исследуемый параметр Х (то есть значение параметра Х находится внутри этого интервала) с заданной надежностью γ.

Обычно надежность оценки задается наперед, причем в качестве γ берут число, близкое к единице: 0,95; 0,99 или 0,999.

Предельная ошибка δ связана со средней ошибкой μ следующим соотношением: , (31)

где: t – коэффициент доверия, зависящий от вероятности P, с которой можно утверждать, что предельная ошибка δ не превысит t-кратную среднюю ошибку μ (его еще называют критическими точками или квантилями распределения Стьюдента).

Как следует из соотношения , предельная ошибка прямо пропорциональна средней ошибке выборки и коэффициенту доверия, зависящему от заданного уровня надежности оценки.

Из формулы средней ошибки выборки и соотношения предельной и средней ошибок получаем:

С учетом доверительной вероятности эта формула примет вид.

Основное преимущество выборочного наблюдения среди прочих других - возможность рассчитать случайную ошибку выборки.

Ошибки выборки бывают систематические и случайные.

Систематические - в том случае, когда нарушен основной принцип выборки - случайности. Случайные - возникают обычно ввиду того, что структура выборочной совокупности всегда отличается от структуры генеральной совокупности, как бы правильно ни был произведен отбор, то есть, несмотря на принцип случайности отбора единиц совокупности, все же имеются расхождения между характеристиками выборочной и генеральной совокупности. Изучение и измерение случайных ошибок репрезентативности и является основной задачей выборочного метода.

Как правило, чаще всего рассчитывают ошибку средней и ошибку доли. При расчетах используются следующие условные обозначения:

Средняя, рассчитанная в пределах генеральной совокупности;

Средняя, рассчитанная в пределах выборочной совокупности;

р - доля данной группы в генеральной совокупности;

w - доля данной группы в выборочной совокупности.

Используя условные обозначения, ошибки выборки для средней и для доли можно записать следующим образом:

Выборочная средняя и выборочная доля являются случайными величинами, которые могут принимать любые значения в зависимости от того, какие единицы совокупности попали в выборку. Следовательно, ошибки выборки также являются случайными величинами и могут принимать различные значения. Поэтому определяют среднюю из возможных ошибок μ.

В отличие от систематической, случайную ошибку можно определить заранее, до проведения выборки, согласно предельных теорем, рассматриваемых в математической статистике.

Средняя ошибка определяется с вероятностью 0,683. В случае другой вероятности говорят о предельной ошибке.

Средняя ошибка выборки для средней и для доли определяется следующим образом:

В этих формулах дисперсия признака является характеристикой генеральной совокупности, которые при выборочном наблюдении неизвестны. На практике их заменяют аналогичными xapaктеристиками выборочной совокупности на основании закона больших чисел, по которому выборочная совокупность большом объеме точно воспроизводит характеристики генеральной совокупности.

Формулы определения средней ошибки для различных способ отбора:

Способ отбора	Повторный	Бесповторный
ошибка средней	ошибка доли	ошибка средней	ошибка доли
Собственно-случайный и механический
Типический
Серийный

μ - средняя ошибка;

∆ - предельная ошибка;

п - численность выборки;

N - численность генеральной совокупности;

Общая дисперсия;

w - доля данной категории в общей численности выборки:

Средняя из внутригрупповых дисперсии;

Δ 2 - межгрупповая дисперсия;

r - число серий в выборке;

R - общее число серий.

Предельная ошибка для всех способов отбора связана со средней ошибкой выборки следующим образом:

где t - коэффициент доверия, функционально связанный с вероятностью, с которой обеспечивается величина предельной ошибки. В зависимости от вероятности коэффициент доверия t принимает следующие значения:

t	P
	0,683
1,5	0,866
2,0	0,954
2,5	0,988
3,0	0,997
4,0	0,9999

Например, вероятность ошибки равна 0,683. Это значит, что генеральная средняя отличается от выборочной средней по абсолютной величине не более чем на величину μ с вероятностью 0,683, то если - выборочная средняя, - генеральная средняя, то с вероятностью 0,683.

Если мы хотим обеспечить большую вероятность выводов, тем самым мы увеличиваем границы случайной ошибки.

Таким образом, величина предельной ошибки зависит от следующих величин:

Колеблемости признака (прямая связь), которую характеризует величина дисперсии;

Численности выборки (обратная связь);

Доверительной вероятности (прямая связь);

Метода отбора.

Пример расчета ошибки средней и ошибки доли.

Для определения среднего числа детей в семье методом случайной бесповторной выборки из 1000 семей отобраны 100. Результаты приведены в таблице:

Определите: .

- с вероятностью 0,997 предельную ошибку выборки и границы, в которых находится средне число детей в семье;

- с вероятностью 0,954 границы, в которых находится удельный вес семей с двумя детьми.

1. Определим предельную ошибку средней с вероятностью 0,977. Для упрощения расчетов воспользуемся способом моментов:

p = 0,997 t = 3

средняя ошибка средней, 0,116 - предельная ошибка

2,12 – 0,116 ≤ ≤ 2,12+ 0,116

2,004 ≤ ≤ 2,236

Следовательно, с вероятностью 0,997 среднее число детей в семье в генеральной совокупности, то есть среди 1000 семей, находится в интервале 2,004 - 2,236.

Предельная ошибка выборки равна t-кратному числу средних ошибок выборки:

μ – средняя ошибка выборки, рассчитанная с учетом поправки, на которую производится корректировка в случае бесповторного отбора ;

t – коэффициент доверия, который находят при заданном уровне вероятности. Так для Р=0,997 по таблице значений интегральной функции Лапласа t=3

Величина предельной ошибки выборки может быть установлена с определенной вероятностью . Вероятность появления такой ошибки, равной или больше утроенной средней ошибки выборки, крайне мала и равна 0,003 (1–0,997). Такие маловероятные события считаются практически невозможными, а потому вероятность того, что эта разность превысит трехкратную величину средней ошибки, определяет уровень ошибки и составляет не более 0,3% .

Определение предельной ошибки выборки для доли

Условие:

Из готовой продукции, в порядке собственно-случайного бесповторного отбора , было отобрано 200 ц, из которых 8 ц оказалось испорчено. Можно ли полагать с вероятностью 0,954, что потери продукции не превысят 5%, если выборка составляет 1:20 часть ее размера?

Дано :

n =200ц – объем выборки (выборочная совокупность)
m =8ц - кол-во испорченной продукции
n:N = 1:20 – пропорция отбора, где N- объем совокупности (генеральная совокупность)
Р = 0,954 – вероятность

Определить : ∆ ω < 5% (согласуется ли то, что потери продукции не превысят 5%)

Решение:

1. Определим выборочную долю-такую долю составляет испорченная продукция в выборочной совокупности:

2. Определим объем генеральной совокупности:

N=n*20=200*20=4000(ц) – количество всей продукции.

3. Определим предельную ошибку выборки для доли продукции, обладающей соответствующим признаком, т.е. для доли испорченной продукции: Δ = t*μ , где µ — средняя ошибка доли, обладающей альтернативным признаком, с учетом поправки, на которую производится корректировка в случае бесповторного отбора; t – коэффициент доверия, который находят при заданном уровне вероятности Р=0,954 по таблице значений интегральной функции Лапласа : t=2

4. Определим границы доверительного интервала для доли альтернативного признака в генеральной совокупности, т.е. какую долю испорченная продукция составит в общем объеме: поскольку доля испорченной продукции в выборочном объеме составляет ω = 0,04, то с учетом предельной ошибки ∆ ω = 0,027 генеральная доля альтернативного признака (p) примет значения:

ω-∆ ω < p < ω+∆ ω

0.04-0.027< p < 0.04+0.027

0.013 < p < 0.067

Вывод: с вероятностью Р=0,954 можно утверждать, что доля испорченной продукции при выборке большего объема не выйдет за пределы найденного интервала (не менее 1,3% и не более 6,7%). Но остается вероятность того, что доля испорченной продукции может превысить 5% в пределах до 6,7%, что, в свою очередь, не согласуется с утверждением ∆ ω < 5%.

*******

Условие:

Менеджер магазина по опыту знает, что 25% входящих в магазин покупателей, совершают покупки. Предположим, что в магазин вошло 200 покупателей.

Определить:

долю покупателей, совершивших покупки
дисперсию выборочной доли
среднее квадратическое отклонение выборочной доли
вероятность того, что выборочная доля будет в пределах между 0,25 и 0,30

Решение:

В качестве генеральной доли (p ) принимаем выборочную долю (ω ) и определяем верхнюю границу доверительного интервала.
Зная критическую точку (по условию: выборочная доля будет в пределах 0,25-0,30), строим одностороннюю критическую область (правостороннюю).
По таблице значений интегральной функции Лапласа находим Z
Этот же вариант можно рассматривать и как повторный отбор при условии, если один и тот же покупатель, не купив в 1-й раз, возвращается и совершает покупку.

В случае, если выборку рассматривать как бесповторную , необходимо среднюю ошибку скорректировать на поправочный коэффициент. Тогда, подставив скоррекированные значения предельной ошибки для выборочной доли, при определении критической области, изменятся Z и P

Определение предельной ошибки выборки для средней

По данным 17 сотрудников фирмы, где работает 260 человек, среднемесячная заработная плата составила 360 у.е., при s=76 у.е. Какая минимальная сумма должна быть положена на счет фирмы, чтобы с вероятностью 0,98 гарантировать выдачу заработной платы всем сотрудникам?

Дано :

n=17 - объем выборки (выборочная совокупность)
N=260 - объем совокупности (генеральная совокупность)
Х ср. =360 - выборочная средняя
S=76 - выборочное среднеквадратическое отклонение
Р = 0,98 – доверительная вероятность

Определить: минимально допустимое значение генеральной средней (нижнюю границу доверительного интервала).

Понятие и расчет ошибки выборки.

Задачей выборочного наблюдения является дача верных представлений о сводных показателях всей совокупности на основе некоторой их части, подвергнутой наблюдению. Возможное отклонение выборочной доли и выборочной средней от доли и средней в генеральной совокупности называется ошибкойвыборки или ошибкойрепрезентативности. Чем больше величина этой ошибки, тем больше показатели выборочного наблюдения отличаются от показателей генеральной совокупности.

Различаются:

Ошибки выборки;

Ошибки регистрации.

Ошибки регистрации возникают при неправильном установлении факта в процессе наблюдения. Они свойственны как сплошному наблюдению, так и выборочному, но в выборочном их меньше.

По природе ошибки бывают:

Тенденциозные – преднамеренные, т.е. были отобраны либо лучшие, либо худшие единицы совокупности. При этом наблюдения теряют смысл;

Случайные – основной организационный принцип выборочного наблюдения состоит в том, чтобы не допустить преднамеренного отбора, т.е. обеспечить строгое соблюдение принципа случайного отбора.

Общим правилом случайного отбора является: у отдельных единиц генеральной совокупности должны быть совершенно одинаковые условия и возможности упасть в число единиц, входящих в выборку. Это характеризует независимость результата выборки от воли наблюдателя. Воля же наблюдателя порождает тенденциозные ошибки. Ошибка выборки при случайном отборе носит случайный характер. Она характеризует размеры отклонений генеральных характеристик от выборочных.

В связи с тем, что признаки в изучаемой совокупности варьируют, то состав единиц, попавших в выборку, может не совпадать с составом единиц всей совокупности. Это означает, что Р и не совпадают с W и . Возможное расхождение между этими характеристиками определяется ошибкой выборки, которая определяется по формуле:

где - генеральная дисперсия.

где - выборочная дисперсия.

Отсюда видно, где генеральная дисперсия отличается от выборочной дисперсии в раз.

Существует повторный и бесповторный отбор. Сущность повторного отбора состоит в том, что каждая, попавшая в выборку единица, после наблюдения возвращается в генеральную совокупность и может быть исследована повторно. При повторном отборе средняя ошибка выборки рассчитывается:

Для показателя доли альтернативного признака дисперсия выборки определяется по формуле:

На практике повторный отбор применяется редко. При бесповторном отборе, численность генеральной совокупности N в ходе выборки сокращается, формула средней ошибки выборки для количественного признака имеет вид:

Одно из возможных значений, в которых может находиться доля изучаемого признака равно:

где - ошибка выборки альтернативного признака.

Пример .

При выборочном обследовании 10 % изделий партии готовой продукции по методу без повторного отбора получены следующие данные о содержании влаг в образцах.

Определить средний % влажности, дисперсию, среднее квадратическое отклонение, с вероятностью 0,954 возможные пределы, в которых ожидается ср. % влажности всей готовой продукции, с вероятность 0,987 возможные пределы удельного веса стандартной продукции при условии, что к нестандартной партии относятся изделия с влажностью до 13 и выше 19 %.

Лишь с определенной вероятностью можно утверждать, что генеральная доля от выборочной доли и генеральная средняя от выборочной средней, отклоняются в t раз.

В статистике эти отклонения называются предельнымиошибкамивыборки и обозначаются .

Вероятность суждений можно повысить или понизить в t раз. При вероятности 0,683 , при 0,954 , при 0,987 , тогда показатели генеральной совокупности по показателям выборки определяются:

На основании зарегистрированных в соответствии с программой статистического наблюдения значений признаков единиц выборочной совокупности рассчитываются обобщающие выборочные характеристики: выборочная средняя () и выборочная доля единиц, обладающих каким-либо интересующим исследователей признаком, в общей их численности (w ).

Разность между показателями выборочной и генеральной совокупности называется ошибкой выборки .

Ошибки выборки, как ошибки любого другого вида статистического наблюдения, подразделяются на ошибки регистрации и ошибки репрезентативности. Основной задачей выборочного метода является изучение и измерение случайных ошибок репрезентативности.

Выборочная средняя и выборочная доля являются случайными величинами, которые могут принимать различные значения в зависимости от того, какие единицы совокупности попали в выборку. Следовательно, ошибки выборки также являются случайными величинами и могут принимать различные значения. Поэтому определяют среднюю из возможных ошибок.

Средняя ошибка выборки (µ - мю) равна:

для средней ; для доли ,

где р - доля определенного признака в генеральной совокупности.

В этих формулах σ х 2 и р (1-р ) являются характеристиками генеральной совокупности, которые при выборочном наблюдении неизвестны. На практике их заменяют аналогичными характеристиками выборочной совокупности на основании закона больших чисел, по которому выборочная совокупность при достаточно большом объеме достаточно точно воспроизводит характеристики генеральной совокупности. Методы расчета средних ошибок выборки для средней и для доли при повторном и бесповторном отборах приведены в табл. 6.1.

Таблица 6.1.

Формулы расчета средней ошибки выборки для средней и для доли

Величина всегда меньше единицы, поэтому величина средней ошибки выборки при бесповторном отборе оказывается меньше, чем при повторном. В тех случаях, когда доля выборки незначительна и множитель близок к единице, поправкой можно пренебречь.

Утверждать, что генеральная средняя значения показателя или генеральная доля не выйдет за границы средней ошибки выборки можно лишь с определенной степенью вероятности. Поэтому, для характеристики ошибки выборки кроме средней ошибки рассчитывают предельную ошибку выборки (Δ), которая связана с гарантирующим ее уровнем вероятности.

Уровень вероятности (Р ) определяет величина нормированного отклонения (t ), и наоборот. Значения t даются в таблицах нормального распределения вероятностей. Наиболее часто используемые сочетания t и Р приведены в табл. 6.2.

Таблица 6.2

Значения нормированного отклонения t при соответствующих значениях уровней вероятности Р

t	1,0	1,5	2,0	2,5	3,0	3,5
Р	0,683	0,866	0,954	0,988	0,997	0,999

t - коэффициент доверия, зависящий от вероятности, с которой можно гарантировать, что предельная ошибка не превысит t -кратную среднюю ошибку. Он показывает, сколько средних ошибок содержится в предельной ошибке . Так, если t = 1, то с вероятностью 0,683 можно утверждать, что разность между выборочными и генеральными показателями не превысит одной средней ошибки.

Формулы для расчета предельных ошибок выборки приведены в табл. 6.3.

Таблица 6.3.

Формулы расчета предельной ошибки выборки для средней и для доли

После исчисления предельных ошибок выборки находят доверительные интервалы для генеральных показателей . Вероятность, которая принимается при расчете ошибки выборочной характеристики, называется доверительной. Доверительный уровень вероятности 0,95 означает, что только в 5 случаях из 100 ошибка может выйти за установленные границы; вероятности 0,954 - в 46 случаях из 1000, а при 0,999 - в 1 случае из 1000.

Для генеральной средней наиболее вероятные границы, в которых она будет находится с учетом предельной ошибки репрезентативности, будут иметь вид:

Наиболее вероятные границы, в которых будет находится генеральная доля, будут иметь вид:

Отсюда, генеральная средняя , генеральная доля .

Приведенные в табл. 6.3. формулы используются при определении ошибок выборки, осуществляемой собственно случайным и механическим методами.

При стратифицированном отборе в выборку обязательно попадают представители всех групп и обычно в тех же пропорциях, что и в генеральной совокупности. Поэтому ошибка выборки в данном случае зависит главным образом от средней из внутригрупповых дисперсий. Исходя из правила сложения дисперсий можно сделать вывод, что ошибка выборки для стратифицированного отбора всегда будет меньше, чем для собственно случайного.

При серийном (гнездовом) отборе мерой колеблемости будет межгрупповая дисперсия.