По данным выборки построить статистический ряд распределения. Статистическое дискретное распределение

Наиболее простым способом обобщения статистического материала является построение рядов. Результатом сводки статистического исследования могут быть ряды распределения.

После определения группировочного признака, количества групп и интервалов группировки данные сводки и группировки представляются в виде рядов распределения и оформляются в виде статистических таблиц.

Ряд распределния является одним из видов группировок.

Рядом распределения в статистике называется упорядоченное распределение единиц совокупности на группы по какому-либо одному признаку: по качественному или количественному.

Виды рядов распределения

В зависимости от признака, положенного в основу образования ряда распределения различают атрибутивные и вариационные ряды распределения:

атрибутивными называют ряды распределения, построенные по качественными признакам;

вариационными называют ряды распределения, построенные в порядке возрастания или убывания значений количественного признака.

Вариационный ряд распределения состоит из двух столбцов. В первом столбце приводятся количественные значения варьирующегося признака, которые называются вариантами и обозначаются. Дискретная варианта - выражается целым числом. Интервальная варианта находится в пределах от и до. В зависимости от типа варианты можно построить дискретный или интервальный вариационный ряд. Во втором столбце содержится количество конкретных вариант, выраженное через частоты или частости:

частоты - это абсолютные числа, показывающие столько раз в совокупности встречается данное значение признака; сумма всех частот должна быть равна численности единиц всей совокупности;

частости - это частоты выраженные в процентах к итогу; сумма всех частостей выраженных в процентах должна быть равна 100% в долях единице.

Вариационный ряд характеризуется двумя элементами: вариантой (Х) и частотой (f). Варианта – это отдельное значение признака отдельной единицы или группы совокупности. Число, показывающее, сколько раз встречается то или иное значение признака, называется частотой. Если частота выражена относительным числом, то она называется частостью.

Вариационный ряд может быть:

интервальным, когда определены границы «от» и «до», интервальные ряды распределения можно представить графически в виде гистограммы;

дискретным, когда изучаемый признак характеризуется определенным числом.

Графическое изображение рядов распределения

Наглядно ряды распределения представляются при помощи графических изображений.

Ряды распределения изображаются в виде:

полигона;

гистограммы;

кумуляты;

При построении полигона на горизонтальной оси (ось абсцисс) откладывают значения варьирующего признака, а на вертикальной оси (ось ординат) - частоты или частости.

Для построения гистограммы по оси абсцисс указывают значения границ интервалов и на их основании строят прямоугольники, высота которых пропорциональна частотам (или частостям).

Распределение признака в вариационном ряду по накопленным частотам (частостям) изображается с помощью кумуляты.

Кумулята или кумулятивная кривая в отличие от полигона строится по накопленным частотам или частостям. При этом на оси абсцисс помещают значения признака, а на оси ординат - накопленные частоты или частости.

Огива строится аналогично кумуляте с той лишь разницей, что накопленные частоты помещают на оси абсцисс, а значения признака - на оси ординат.

Разновидностью кумуляты является кривая концентрации или график Лоренца. Для построения кривой концентрации на обе оси прямоугольной системы координат наносится масштабная шкала в процентах от 0 до 100. При этом на оси абсцисс указывают накопленные частости, а на оси ординат - накопленные значения доли (в процентах) по объему признака.

Что такое группировка статистических данных, и как она связана с рядами распределения, было рассмотрено этой лекции, там же можно узнать, о том что такое дискретный и вариационный ряд распределения.

Ряды распределения одна из разновидностей статистических рядов (кроме них в статистике используются ряды динамики), используются для анализа данных о явлениях общественной жизни. Построение вариационных рядов вполне посильная задача для каждого. Однако есть правила, которые необходимо помнить.

Как построить дискретный вариационный ряд распределения

Пример 1. Имеются данные о количестве детей в 20 обследованных семьях. Построить дискретный вариационный ряд распределения семей по числу детей .

0 1 2 3 1
2 1 2 1 0
4 3 2 1 1
1 0 1 0 2

Решение:

Начнем с макета таблицы, в которую затем мы внесем данные. Так как ряды распределения имеют два элемента, то таблица состоять будет из двух колонок. Первая колонка это всегда варианта – то, что мы изучаем – ее название берем из задания (конец предложения с заданием в условиях) — по числу детей – значит наша варианта это число детей.

Вторая колонка это частота – как часто встречается наша варианта в исследуемом явление – название колонки так же берем из задания — распределения семей – значит наша частота это число семей с соответствующим количеством детей.

Теперь из исходных данных выберем те значения, которые встречаются хотя бы один раз. В нашем случае это

И расставим эти данные в первой колонке нашей таблицы в логическом порядке, в данном случае возрастающем от 0 до 4. Получаем

И в заключение подсчитаем, сколько же раз встречается каждое значение варианты.

0 1 2 3 1

2 1 2 1 0

4 3 2 1 1

1 0 1 0 2

В результате получаем законченную табличку или требуемый ряд распределения семей по количеству детей.

Задание . Имеются данные о тарифных разрядах 30 рабочих предприятия. Построить дискретный вариационный ряд распределения рабочих по тарифному разряду. 2 3 2 4 4 5 5 4 6 3

1 4 4 5 5 6 4 3 2 3

4 5 4 5 5 6 6 3 3 4

Как построить интервальный вариационный ряд распределения

Построим интервальный ряд распределения, и посмотрим чем же его построение отличается от дискретного ряда.

Пример 2. Имеются данные о величине полученной прибыли 16 предприятий, млн. руб. — 23 48 57 12 118 9 16 22 27 48 56 87 45 98 88 63. Построить интервальный вариационный ряд распределения предприятий по объему прибыли, выделив 3 группы с равными интервалами.

Общий принцип построения ряда, конечно же, сохраниться, те же две колонки, те же варианта и частота, но в здесь варианта будет располагаться в интервале и подсчет частот будет вестись иначе.

Решение:

Начнем аналогично предыдущей задачи с построения макета таблицы, в которую затем мы внесем данные. Так как ряды распределения имеют два элемента, то таблица состоять будет из двух колонок. Первая колонка это всегда варианта – то, что мы изучаем – ее название берем из задания (конец предложения с заданием в условиях) — по объему прибыли – значит, наша варианта это объем полученной прибыли.

Вторая колонка это частота – как часто встречается наша варианта в исследуемом явление – название колонки так же берем из задания — распределения предприятий – значит наша частота это число предприятий с соответствующей прибылью, в данном случае попадающие в интервал.

В итоге макет нашей таблицы будет выглядеть так:

где i – величина или длинна интервала,

Хmax и Xmin – максимальное и минимальное значение признака,

n – требуемое число групп по условию задачи.

Рассчитаем величину интервала для нашего примера. Для этого среди исходных данных найдем самое большое и самое маленькое

23 48 57 12 118 9 16 22 27 48 56 87 45 98 88 63 – максимальное значение 118 млн. руб., и минимальное 9 млн. руб. Проведем расчет по формуле.

В расчете получили число 36,(3) три в периоде, в таких ситуациях величину интервала нужно округлить до большего, чтобы после подсчетов не потерялось максимальное данное, именно поэтому в расчете величина интервала 36,4 млн. руб.

Теперь построим интервалы – наши варианты в данной задаче. Первый интервал начинают строить от минимального значения к нему добавляется величина интервала и получается верхняя граница первого интервала. Затем верхняя граница первого интервала становится нижней границей второго интервала, к ней добавляется величина интервала и получается второй интервал. И так далее столько раз сколько требуется построить интервалов по условию.

Обратим внимание если бы мы не округлили величину интервала до 36,4, а оставили бы ее 36,3, то последнее значение у нас бы получилось 117,9. Именно для того чтобы не было потери данных необходимо округлять величину интервала до большего значения.

Проведем подсчет количества предприятий попавших в каждый конкретный интервал. При обработке данных необходимо помнить, что верхнее значение интервала в данном интервале не учитывается (не включается в этот интервал), а учитывается в следующем интервале (нижняя граница интервала включается в данный интервал, а верхняя не включается), за исключением последнего интервала.

При проведении обработки данных лучше всего отобранные данные обозначить условными значками или цветом, для упрощения обработки.

23 48 57 12 118 9 16 22

27 48 56 87 45 98 88 63

Первый интервал обозначим желтым цветом – и определим сколько данных попадает в интервал от 9 до 45,4, при этом данное 45,4 будет учитываться во втором интервале (при условии что оно есть в данных) – в итоге получаем 7 предприятий в первом интервале. И так дальше по всем интервалам.

(дополнительное действие ) Проведем подсчет общего объема прибыли полученного предприятиями по каждому интервалу и в целом. Для этого сложим данные отмеченные разными цветами и получим суммарное значение прибыли.

По первому интервалу — 23 + 12 + 9 + 16 + 22 + 27 + 45 = 154 млн. руб.

По второму интервалу — 48 + 57 + 48 + 56 + 63 = 272 млн. руб.

По третьему интервалу — 118 + 87 + 98 + 88 = 391 млн. руб.

Задание . Имеются данные о величине вклада в банке 30 вкладчиков, тыс. руб. 150, 120, 300, 650, 1500, 900, 450, 500, 380, 440,

600, 80, 150, 180, 250, 350, 90, 470, 1100, 800,

500, 520, 480, 630, 650, 670, 220, 140, 680, 320

Построить интервальный вариационный ряд распределения вкладчиков, по размеру вклада выделив 4 группы с равными интервалами. По каждой группе подсчитать общий размер вкладов.

Математическая статистика - раздел математики, посвященный математическим методам обработки, систематизации и использования статистических данных для научных и практических выводов.

3.1. ОСНОВНЫЕ ПОНЯТИЯ МАТЕМАТИЧЕСКОЙ СТАТИСТИКИ

В медико-биологических задачах часто приходится исследовать распределение того или иного признака для очень большого числа индивидуумов. У разных индивидуумов этот признак имеет различное значение, поэтому он является случайной величиной. Например, любой лечебный препарата имеет различную эффективность при его применении к разным пациентам. Однако для того чтобы составить представление об эффективности данного препарата, нет необходимости применять его ко всем больным. Можно проследить результаты применения препарата к сравнительно небольшой группе больных и на основании полученных данных выявить существенные черты (эффективность, противопоказания) процесса лечения.

Генеральная совокупность - подлежащая изучению совокупность однородных элементов, характеризуемых некоторым признаком. Этот признак является непрерывной случайной величиной с плотностью распределения f(x).

Например, если нас интересует распространенность какого-либо заболевания в некотором регионе, то генеральная совокупность - все население региона. Если же мы хотим выяснить подверженность этому заболеванию мужчин и женщин по отдельности, то следует рассматривать две генеральные совокупности.

Для изучения свойств генеральной совокупности отбирают некоторую часть ее элементов.

Выборка - часть генеральной совокупности, выбираемая для обследования (лечения).

Если это не вызывает недоразумений, то выборкой называют как совокупность объектов, отобранных для обследования, так и совокупность

значений исследуемого признака, полученных при обследовании. Эти значения могут быть представлены несколькими способами.

Простой статистический ряд - значения исследуемого признака, записанные в том порядке, в котором они были получены.

Пример простого статистического ряда, полученного при измерении скорости поверхностной волны (м/с) в коже лба у 20 пациентов приведен в табл. 3.1.

Таблица 3.1. Простой статистический ряд

Простой статистический ряд - основной и самый полный способ записи результатов обследования. Он может содержать сотни элементов. Окинуть такую совокупность одним взглядом весьма затруднительно. Поэтому большие выборки обычно подвергают разбиению на группы. Для этого область изменения признака разбивают на несколько (N) интервалов равной ширины и подсчитывают относительные частоты (n/n) попадания признака в эти интервалы. Ширина каждого интервала равна:

Границы интервалов имеют следующие значения:

Если какой-то элемент выборки является границей между двумя соседними интервалами, то его относят к левому интервалу. Сгруппированные таким образом данные называют интервальным статистическим рядом.

- это таблица, в которой приведены интервалы значений признака и относительные частоты попадания признака в эти интервалы.

В нашем случае можно образовать, например, такой интервальный статистический ряд (N = 5, d = 4), табл. 3.2.

Таблица 3.2. Интервальный статистический ряд

Здесь к интервалу 28-32 отнесены два значения равные 28 (табл. 3.1), а к интервалу 32-36 - значения 32, 33, 34 и 35.

Интервальный статистический ряд можно изобразить графически. Для этого по оси абсцисс откладывают интервалы значений признака и на каждом из них, как на основании, строят прямоугольник с высотой, равной относительной частоте. Полученная столбцовая диаграмма называется гистограммой.

Рис. 3.1. Гистограмма

На гистограмме статистические закономерности распределения признака просматриваются достаточно отчетливо.

При большом объеме выборки (несколько тысяч) и малой ширине столбцов форма гистограммы близка к форме графика плотности распределения признака.

Число столбцов гистограммы можно выбрать по следующей формуле:

Построение гистограммы вручную - процесс долгий. Поэтому разработаны компьютерные программы для их автоматического построения.

3.2. ЧИСЛОВЫЕ ХАРАКТЕРИСТИКИ СТАТИСТИЧЕСКОГО РЯДА

Многие статистические процедуры используют выборочные оценки для математического ожидания и дисперсии (или СКО) генеральной совокупности.

Выборочное среднее (Х) - это среднее арифметическое всех элементов простого статистического ряда:

Для нашего примера Х = 37,05 (м/с).

Выборочное среднее - это наилучшая оценка генерального среднего М.

Выборочная дисперсия s 2 равна сумме квадратов отклонений элементов от выборочного среднего, поделенной на n - 1:

В нашем примере s 2 = 25,2 (м/с) 2 .

Обратите внимание, что при вычислении выборочной дисперсии в знаменателе формулы стоит не объем выборки n, а n-1. Это связано с тем, что при вычислении отклонений в формуле (3.3) вместо неизвестного математического ожидания используется его оценка - выборочное среднее.

Выборочная дисперсия - это наилучшая оценка генеральной дисперсии (σ 2).

Выборочное среднеквадратическое отклонение (s) - это квадратный корень из выборочной дисперсии:

Для нашего примера s = 5,02 (м/с).

Выборочное среднеквадратическое отклонение - это наилучшая оценка генерального СКО (σ).

При неограниченном увеличении объема выборки все выборочные характеристики стремятся к соответствующим характеристикам генеральной совокупности.

Для вычисления выборочных характеристик используют компьютерные формулы. В приложении Excel эти вычисления выполняют статистические функции СРЗНАЧ, ДИСП. СТАНДОТКЛОН.

3.3. ИНТЕРВАЛЬНАЯ ОЦЕНКА

Все выборочные характеристики являются случайными величинами. Это означает, что для другой выборки того же объема значения выборочных характеристик получатся другими. Таким образом, выборочные

характеристики являются лишь оценками соответствующих характеристик генеральной совокупности.

Недостатки выборочного оценивания компенсирует интервальная оценка, представляющая числовой интервал, внутри которого с заданной вероятностью Р д находится истинное значение оцениваемого параметра.

Пусть U r - некоторый параметр генеральной совокупности (генеральное среднее, генеральная дисперсия и т.д.).

Интервальной оценкой параметра U r называется интервал (U 1 , U 2), удовлетворяющий условию:

P(U < Ur < U2) = Рд. (3.5)

Вероятность Р д называется доверительной вероятностью.

Доверительная вероятность Р д - вероятность того, что истинное значение оцениваемой величины находится внутри указанного интервала.

При этом интервал (U 1 , U 2) называется доверительным интервалом для оцениваемого параметра.

Часто вместо доверительной вероятности используют связанную с ней величину α = 1 - Р д, которая называется уровнем значимости.

Уровень значимости - это вероятность того, что истинное значение оцениваемого параметра находится за пределами доверительного интервала.

Иногда α и Р д выражают в процентах, например, 5% вместо 0,05 и 95% вместо 0,95.

При интервальном оценивании сначала выбирают соответствующую доверительную вероятность (обычно 0,95 или 0,99), а затем находят соответствующий интервал значений оцениваемого параметра.

Отметим некоторые общие свойства интервальных оценок.

1. Чем ниже уровень значимости (чем больше Р д), тем шире интервальная оценка. Так, если при уровне значимости 0,05 интервальная оценка генерального среднего есть 34,7 < М < 39,4, то для уровня 0,01 она будет гораздо шире: 33,85 < М < 40,25.

2. Чем больше объем выборки n, тем уже интервальная оценка с выбранным уровнем значимости. Пусть, например, 5 - процентная оценка генеральной средней (β=0,05), полученная по выборке из 20 элементов, тогда 34,7 < М < 39,4.

Увеличив объем выборки до 80, мы при том же уровне значимости получим более точную оценку: 35,5 < М < 38,6.

В общем случае построение надежных доверительных оценок требует знания закона, по которому оцениваемый случайный признак распределен в генеральной совокупности. Рассмотрим, как строится интервальная оценка генерального среднего признака, который распределен в генеральной совокупности по нормальному закону.

3.4. ИНТЕРВАЛЬНАЯ ОЦЕНКА ГЕНЕРАЛЬНОГО СРЕДНЕГО ДЛЯ НОРМАЛЬНОГО ЗАКОНА РАСПРЕДЕЛЕНИЯ

Построение интервальной оценки генерального среднего М для генеральной совокупности с нормальным законом распределения основано на следующем свойстве. Для выборки объема n отношение

подчиняется распределению Стьюдента с числом степеней свободы ν = n - 1.

Здесь Х - выборочное среднее, а s - выборочное СКО.

Используя таблицы распределения Стьюдента или их компьютерный аналог, можно найти такое граничное значение что c заданной доверительной вероятностью выполняется неравенство:

Этому неравенству соответствует неравенство для М:

где ε - полуширина доверительного интервала.

Таким образом, построение доверительного интервала для М проводится в следующей последовательности.

1. Выбирают доверительную вероятность Р д (обычно 0,95 или 0,99) и для нее по таблице распределения Стьюдента находят параметр t

2. Рассчитывают полуширину доверительного интервала ε:

3. Получают интервальную оценку генерального среднего с выбранной доверительной вероятностью:

Кратко это записывается так:

Для нахождения интервальных оценок разработаны компьютерные процедуры.

Поясним, как пользоваться таблицей распределения Стьюдента. Эта таблица имеет два «входа»: левый столбец, называемый числом степеней свободы ν = n - 1, и верхняя строка - уровень значимости α. На пересечении соответствующей строки и столбца находят коэффициент Стьюдента t.

Применим этот метод к нашей выборке. Фрагмент таблицы распределения Стьюдента представлен ниже.

Таблица 3.3. Фрагмент таблицы распределения Стьюдента

Простой статистический ряд для выборки из 20 человек (n = 20, ν =19) представлен в табл. 3.1. Для этого ряда расчеты по формулам (3.1-3.3) дают: Х = 37,05; s = 5,02.

Выберем α = 0,05 (Р д = 0,95). На пересечении строки «19» и столбца «0,05» найдем t = 2,09.

Вычислим точность оценки по формуле (3.6): ε = 2,09?5,02/λ /20 = 2,34.

Построим интервальную оценку: с вероятностью 95% неизвестное генеральное среднее удовлетворяет неравенству:

37,05 - 2,34 < М < 37,05 + 2,34, или М = 37,05 ± 2,34 (м/с), Р д = 0,95.

3.5. МЕТОДЫ ПРОВЕРКИ СТАТИСТИЧЕСКИХ ГИПОТЕЗ

Статистические гипотезы

Прежде чем сформулировать, что такое статистическая гипотеза, рассмотрим следующий пример.

Для сравнения двух методик лечения некоторого заболевания были отобраны две группы пациентов по 20 человек, лечение которых проводилось по этим методикам. Для каждого пациента фиксировалось количество процедур, после которого достигался положительный эффект. По этим данным для каждой группы находились выборочные средние (Х), выборочные дисперсии (s 2) и выборочные СКО (s).

Результаты представлены в табл. 3.4.

Таблица 3.4

Количество процедур, необходимое для получения положительного эффекта, - случайная величина, вся информация о которой на данный момент содержится в приведенной выборке.

Из табл. 3.4 видно, что выборочное среднее в первой группе меньше, чем во второй. Означает ли это, что и для генеральных средних имеет место такое же соотношение: М 1 < М 2 ? Достаточно ли статистических данных для такого вывода? Ответы на эти вопросы и дает статистическая проверка гипотез.

Статистическая гипотеза - это предположение относительно свойств генеральных совокупностей.

Мы будем рассматривать гипотезы о свойствах двух генеральных совокупностей.

Если генеральные совокупности имеют известные, одинаковые распределения оцениваемой величины, а предположения касаются величин некоторого параметра этого распределения, то гипотезы называются параметрическими. Например, выборки извлечены из генеральных совокупностей с нормальным законом распределения и одинаковой дисперсией. Требуется выяснить, одинаковы ли генеральные средние этих совокупностей.

Если о законах распределения генеральных совокупностей ничего не известно, то гипотезы об их свойствах называют непараметрическими. Например, одинаковы ли законы распределения генеральных совокупностей, из которых извлечены выборки.

Нулевая и альтернативная гипотезы.

Задача проверки гипотез. Уровень значимости

Познакомимся с терминологией, применяемой при проверке гипотез.

Н 0 - нулевая гипотеза (гипотеза скептика) - это гипотеза об отсутствии различий между сравниваемыми выборками. Скептик считает, что различия между выборочными оценками, полученными по результатам исследований, - случайны;

Н 1 - альтернативная гипотеза (гипотеза оптимиста) - это гипотеза о наличии различий между сравниваемыми выборками. Оптимист считает, что различия между выборочными оценками вызваны объективными причинами и соответствуют различиям генеральных совокупностей.

Проверка статистических гипотез осуществима только тогда, когда из элементов сравниваемых выборок можно составить некоторую величину (критерий), закон распределения которой в случае справедливости Н 0 известен. Тогда для этой величины можно указать доверительный интервал, в который с заданной вероятностью Р д попадает ее значение. Этот интервал называют критической областью. Если значение критерия попадает в критическую область, то принимается гипотеза Н 0 . В противном случае принимается гипотеза Н 1 .

В медицинских исследованиях используют Р д = 0,95 или Р д = 0,99. Этим значениям соответствуют уровни значимости α = 0,05 или α = 0,01.

При проверке статистических гипотез уровнем значимости (α) называется вероятность отклонения нулевой гипотезы, когда она верна.

Обратите внимание на то, что по своей сути процедура проверки гипотез направлена на обнаружение различий, а не на подтверждение их отсутствия. При выходе значения критерия за пределы критической области мы можем с чистым сердцем сказать «скептику» - ну что, Вы еще хотите?! Если бы различия отсутствовали, то с вероятностью 95% (или 99%) расчетное значение было бы в указанных пределах. Так ведь нет!..

Ну а если значение критерия попадает в критическую область, то нет никаких оснований считать что гипотеза Н 0 верна. Это, скорее всего, указывает на одну из двух возможных причин.

1. Объемы выборок недостаточно велики, чтобы обнаружить имеющиеся различия. Вполне вероятно, что продолжение экспериментов принесет успех.

2. Различия есть. Но они настолько малы, что не имеют практического значения. В этом случае продолжение экспериментов не имеет смысла.

Перейдем к рассмотрению некоторых статистических гипотез, используемых в медицинских исследованиях.

3.6. ПРОВЕРКА ГИПОТЕЗ О РАВЕНСТВЕ ДИСПЕРСИЙ, F-КРИТЕРИЙ ФИШЕРА

В некоторых клинических исследованиях о положительном эффекте свидетельствует не столько величина исследуемого параметра, сколько его стабилизация, уменьшение его колебаний. В этом случае возникает вопрос о сравнении двух генеральных дисперсий по результатам выборочного обследования. Эта задача может быть решена с помощью критерия Фишера.

Постановка задачи

нормальным законом распределения. Объемы выборок -

n 1 и n 2 , а выборочные дисперсии равны s 1 и s 2 2 генеральные дисперсии.

Проверяемые гипотезы:

Н 0 - генеральные дисперсии одинаковы;

Н 1 - генеральные дисперсии различны.

Показано, если выборки извлечены из генеральных совокупностей с нормальным законом распределения, то при справедливости гипотезы Н 0 отношение выборочных дисперсий подчиняется распределению Фишера. Поэтому в качестве критерия для проверки справедливости Н 0 берется величина F, вычисляемая по формуле:

где s 1 и s 2 - выборочные дисперсии.

Это отношение подчиняется распределению Фишера с числом степеней свободы числителя ν 1 = n 1 - 1 и числом степеней свободы знаменателя ν 2 = n 2 - 1. Границы критической области находятся по таблицам распределения Фишера или с помощью компьютерной функции БРАСПОБР.

Для примера, представленного в табл. 3.4, получим: ν 1 = ν 2 = 20 - 1 = 19; F = 2,16/4,05 = 0,53. При α = 0,05 границы критической области равны соответственно: = 0,40, = 2,53.

Значение критерия попало в критическую область, поэтому принимается гипотеза Н 0: генеральные дисперсии выборок одинаковы.

3.7. ПРОВЕРКА ГИПОТЕЗ ОТНОСИТЕЛЬНО РАВЕНСТВА СРЕДНИХ, t-КРИТЕРИЙ СТЬЮДЕНТА

Задача сравнения средних двух генеральных совокупностей возникает, когда практическое значение имеет именно величина исследуемого признака. Например, когда сравниваются сроки лечения двумя различными методами или количества осложнений, возникающих при их применении. В этом случае можно использовать t-критерий Стьюдента.

Постановка задачи

Получены две выборки {Х 1 } и {Х 2 }, извлеченные из генеральных совокупностей с нормальным законом распределения и одинаковыми дисперсиями. Объемы выборок - n 1 и n 2 , выборочные средние равны Х 1 и Х 2, а выборочные дисперсии - s 1 2 и s 2 2 соответственно. Требуется сравнить между собой генеральные средние.

Проверяемые гипотезы:

Н 0 - генеральные средние одинаковы;

Н 1 - генеральные средние различны.

Показано, что в случае справедливости гипотезы Н 0 величина t, вычисляемая по формуле:

распределена по закону Стьюдента с числом степеней свободы ν = ν 1 + + ν2 - 2.

Здесь где ν 1 = n 1 - 1 - число степеней свободы для первой выборки; ν 2 = n 2 - 1 - число степеней свободы для второй выборки.

Границы критической области находят по таблицам t-распределения или с помощью компьютерной функции СТЬЮДРАСПОБР. Распределение Стьюдента симметрично относительно нуля, поэтому левая и правая границы критической области одинаковы по модулю и противоположны по знаку: -и

Для примера, представленного в табл. 3.4, получим:

ν 1 = ν 2 = 20 - 1 = 19; ν = 38, t = -2,51. При α = 0,05 = 2,02.

Значения критерия выходит за левую границу критической области, поэтому принимаем гипотезу Н 1: генеральные средние различны. При этом среднее генеральной совокупности первой выборки МЕНЬШЕ.

Применимость t-критерия Стьюдента

Критерий Стьюдента применим только к выборкам из нормальных совокупностей с одинаковыми генеральными дисперсиями. Если хотя бы одно из условий нарушено, то применимость критерия сомнительна. Требование нормальности генеральной совокупности обычно игнорируют, ссылаясь на центральную предельную теорему. Действительно, разность выборочных средних, стоящая в числителе (3.10), может считаться нормально распределенной при ν > 30. Но вопрос о равенстве дисперсий проверке не подлежит, и ссылки на то, что критерий Фишера не обнаружил различий, принимать во внимание нельзя. Тем не менее t-критерий достаточно широко применяется для обнаружения различий в средних значениях генеральных совокупностей, хотя и без достаточных оснований.

Ниже рассматривается непараметрический критерий, который с успехом используют для этих же целей и который не требует ни нормальности, ни равенства дисперсий.

3.8. НЕПАРАМЕТРИЧЕСКОЕ СРАВНЕНИЕ ДВУХ ВЫБОРОК: КРИТЕРИЙ МАННА-УИТНИ

Непараметрические критерии предназначены для обнаружения различий в законах распределения двух генеральных совокупностей. Критерии, которые чувствительны к различиям генеральных средних, называют критериями сдвига. Критерии, которые чувствительны к различиям генеральных дисперсий, называют критериями масштаба. Критерий Манна-Уитни относится к критериям сдвига и используется для обнаружения различий в средних значениях двух генеральных совокупностей, выборки из которых представлены в ранговой шкале. Измеренные признаки распологаются на этой шкале в порядке возрастания, а затем нумеруются целыми числами 1, 2... Эти числа и называются рангами. Равным величинам присваивают одинаковые ранги. Значение имеет не сама величина признака, а лишь порядковое место, который она занимает среди других величин.

В табл. 3.5. первая группа из таблицы 3.4 представлена в развернутом виде (строка 1), подвергнута ранжированию (стока 2), а затем ранги одинаковых величин заменены среднеарифметическими значениями. Например, элементы 4 и 4, стоящие в первой строке, получили ранги 2 и 3, которые затем заменены на одинаковые значения 2,5.

Таблица 3.5

Постановка задачи

Независимые выборки {Х 1 } и {Х 2 } извлечены из генеральных совокупностей с неизвестными законами распределения. Объемы выборок n 1 и n 2 соответственно. Значения элементов выборок представлены в ранговой шкале. Требуется проверить, различаются ли эти генеральные совокупности между собой?

Проверяемые гипотезы:

Н 0 - выборки принадлежат к одной генеральной совокупности; Н 1 - выборки принадлежат к различным генеральным совокупностям.

Для проверки таких гипотез применяется {/-критерий Манна-Уитни.

Сначала из двух выборок составляется объединенная выборка {X}, элементы которой ранжируются. Затем находится сумма рангов, соответствующих элементам первой выборки. Эта сумма и является критерием для проверки гипотез.

U = Сумме рангов первой выборки. (3.11)

Для независимых выборок, объемы которых больше 20, величина U подчиняется нормальному распределению, математическое ожидание и СКО которого равны:

Поэтому границы критической области находятся по таблицам нормального распределения.

Для примера, представленного в табл. 3.4, получим: ν 1 = ν 2 = 20 - 1 = 19, U = 339, μ = 410, σ = 37. Для α = 0,05 получим: и лев = 338, и прав = 482.

Значение критерия выходит за левую границу критической области, поэтому принимается гипотеза Н 1: генеральные совокупности имеют различные законы распределения. При этом среднее генеральной совокупности первой выборки МЕНЬШЕ.

Важнейшим этапом исследования социально-экономических явлений и процессов является систематизация первичных данных и получение на этой основе сводной характеристики всего объекта при помощи обобщающих показателей, что достигается путем сводки и группировки первичного статистического материала.

Статистическая сводка - это комплекс последовательных операций по обобщению конкретных единичных фактов, образующих совокупность, для выявления типичных черт и закономерностей, присущих изучаемому явлению в целом. Проведение статистической сводки включает следующие этапы :

выбор группировочного признака;
определение порядка формирования групп;
разработка системы статистических показателей для характеристики групп и объекта в целом;
разработка макетов статистических таблиц для представления результатов сводки.

Статистической группировкой называется расчленение единиц изучаемой совокупности на однородные группы по определенным существенным для них признакам. Группировки являются важнейшим статистическим методом обобщения статистических данных, основой для правильного исчисления статистических показателей.

Различают следующие виды группировок: типологические, структурные, аналитические. Все эти группировки объединяет то, что единицы объекта разделены на группы по какому-либо признаку.

Группировочным признаком называется признак, по которому проводится разбиение единиц совокупности на отдельные группы. От правильного выбора группировочного признака зависят выводы статистического исследования. В качестве основания группировки необходимо использовать существенные, теоретически обоснованные признаки (количественные или качественные).

Количественные признаки группировки имеют числовое выражение (объем торгов, возраст человека, доход семьи и т. д.), а качественные признаки группировки отражают состояние единицы совокупности (пол, семейное положение, отраслевая принадлежность предприятия, его форма собственности и т. д.).

После того, как определено основание группировки следует решить вопрос о количестве групп, на которые надо разбить исследуемую совокупность. Число групп зависит от задач исследования и вида показателя, положенного в основание группировки, объема совокупности, степени вариации признака.

Например, группировка предприятий по формам собственности учитывает муниципальную, федеральную и собственность субъектов федерации. Если группировка производится по количественному признаку, то тогда необходимо обратить особое внимание на число единиц исследуемого объекта и степень колеблемости группировочного признака.

Когда определено число групп, то следует определить интервалы группировки. Интервал - это значения варьирующего признака, лежащие в определенных границах. Каждый интервал имеет свою величину, верхнюю и нижнюю границы или хотя бы одну из них.

Нижней границей интервала называется наименьшее значение признака в интервале, а верхней границей - наибольшее значение признака в интервале. Величина интервала представляет собой разность между верхней и нижней границами.

Интервалы группировки в зависимости от их величины бывают: равные и неравные. Если вариация признака проявляется в сравнительно узких границах и распределение носит равномерный характер, то строят группировку с равными интервалами. Величина равного интервала определяется по следующей формуле :

где Хmax, Хmin - максимальное и минимальное значения признака в совокупности; n - число групп.

Простейшая группировка, в которой каждая выделенная группа характеризуется одним показателем представляет собой ряд распределения.

Статистический ряд распределения - это упорядоченное распределение единиц совокупности на группы по определенному признаку. В зависимости от признака, положенного в основу образования ряда распределения, различают атрибутивные и вариационные ряды распределения.

Атрибутивными называют ряды распределения, построенные по качественным признакам, то есть признакам, не имеющим числового выражения (распределение по видам труда, по полу, по профессии и т.д.). Атрибутивные ряды распределения характеризуют состав совокупности по тем или иным существенным признакам. Взятые за несколько периодов, эти данные позволяют исследовать изменение структуры.

Вариационными рядами называют ряды распределения, построенные по количественному признаку. Любой вариационный ряд состоит из двух элементов: вариантов и частот. Вариантами называются отдельные значения признака, которые он принимает в вариационном ряду, то есть конкретное значение варьирующего признака.

Частотами называются численности отдельных вариант или каждой группы вариационного ряда, то есть это числа, которые показывают, как часто встречаются те или иные варианты в ряду распределения. Сумма всех частот определяет численность всей совокупности, ее объем. Частостями называются частоты, выраженные в долях единицы или в процентах к итогу. Соответственно сумма частостей равна 1 или 100%.

В зависимости от характера вариации признака различают три формы вариационного ряда: ранжированный ряд, дискретный ряд и интервальный ряд.

Ранжированный вариационный ряд - это распределение отдельных единиц совокупности в порядке возрастания или убывания исследуемого признака. Ранжирование позволяет легко разделить количественные данные по группам, сразу обнаружить наименьшее и наибольшее значения признака, выделить значения, которые чаще всего повторяются.

Дискретный вариационный ряд характеризует распределение единиц совокупности по дискретному признаку, принимающему только целые значения. Например, тарифный разряд, количество детей в семье, число работников на предприятии и др.

Если признак имеет непрерывное изменение, которые в определенных границах могут принимать любые значения («от - до»), то для этого признака нужно строить интервальный вариационный ряд . Например, размер дохода, стаж работы, стоимость основных фондов предприятия и др.

Примеры решения задач по теме «Статистическая сводка и группировка»

Задача 1 . Имеется информация о количестве книг, полученных студентами по абонементу за прошедший учебный год.

Построить ранжированный и дискретный вариационные ряды распределения, обозначив элементы ряда.

Решение

Данная совокупность представляет собой множество вариантов количества получаемых студентами книг. Подсчитаем число таких вариантов и упорядочим в виде вариационного ранжированного и вариационного дискретного рядов распределения.

Задача 2 . Имеются данные о стоимости основных фондов у 50 предприятий, тыс. руб.

Построить ряд распределения, выделив 5 групп предприятий (с равными интервалами).

Решение

Для решения выберем наибольшее и наименьшее значения стоимости основных фондов предприятий. Это 30,0 и 10,2 тыс. руб.

Найдем размер интервала: h = (30,0-10,2):5= 3,96 тыс. руб.

Тогда в первую группу будут входить предприятия, размер основных фондов которых составляет от 10,2 тыс. руб. до 10,2+3,96=14,16 тыс. руб. Таких предприятий будет 9. Во вторую группу войдут предприятия, размер основных фондов которых составит от 14,16 тыс. руб. до 14,16+3,96=18,12 тыс. руб. Таких предприятий будет 16. Аналогично найдем число предприятий, входящих в третью, четвертую и пятую группы.

Полученный ряд распределения поместим в таблицу.

Задача 3 . По ряду предприятий легкой промышленности получены следующие данные:

Произведите группировку предприятий по числу рабочих, образуя 6 групп с равными интервалами. Подсчитайте по каждой группе:

1. число предприятий
2. число рабочих
3. объем произведенной продукции за год
4. среднюю фактическую выработку одного рабочего
5. объем основных средств
6. средний размер основных средств одного предприятия
7. среднюю величину произведенной продукции одним предприятием

Результаты расчета оформите в таблицы. Сделайте выводы.

Решение

Для решения выберем наибольшее и наименьшее значения среднесписочного числа рабочих на предприятии. Это 43 и 256.

Найдем размер интервала: h = (256-43):6 = 35,5

Тогда в первую группу будут входить предприятия, среднесписочное число рабочих на которых составляет от 43 до 43+35,5=78,5 человек. Таких предприятий будет 5. Во вторую группу войдут предприятия, среднесписочное число рабочих на которых составит от 78,5 до 78,5+35,5=114 человек. Таких предприятий будет 12. Аналогично найдем число предприятий, входящих в третью, четвертую, пятую и шестую группы.

Полученный ряд распределения поместим в таблицу и вычислим необходимые показатели по каждой группе:

Вывод : Как видно из таблицы, вторая группа предприятий является самой многочисленной. В нее входят 12 предприятий. Самыми малочисленными являются пятая и шестая группы (по два предприятия). Это самые крупные предприятия (по числу рабочих).

Поскольку вторая группа самая многочисленная, объем произведенной продукции за год предприятиями этой группы и объем основных средств значительно выше других. Вместе с тем средняя фактическая выработка одного рабочего на предприятиях этой группы наибольшей не является. Здесь лидируют предприятия четвертой группы. На эту группу приходится и довольно большой объем основных средств.

В заключении отметим, что средний размер основных средств и средняя величина произведенной продукции одного предприятия прямо пропорциональны размерам предприятия (по числу рабочих).

Особую форму группировки данных представляют так называемые статистические ряды, или числовые значения признака, расположенного в определенном порядке. В зависимости от того, какие признаки изучаются, статистические ряды делят на атрибутивные, вариационные, ряды динамики, регрессии, ряды ранжированных значений признаков и ряды накопленных частот. Наиболее часто в психологии используются вариационные ряды, ряды регрессии и ряды ранжированных значений признаков.

Вариационным рядом распределения называют двойной ряд чисел, показывающий, каким образом числовые значения признака связаны с их повторяемостью в данной выборке. Например, психолог провел тестирование интеллекта по тесту Векслера у 25 школьников, и сырые баллы по второму субтесту оказались следующими: 6, 9, 5, 7, 10, 8, 9, 10, 8, 11, 9, 12, 9, 8, 10, 11, 9, 10, 8, 10, 7, 9, 10, 9, 11. Как видим, некоторые цифры попадаются в данном ряду по несколько раз. Следовательно, учитывая число повторений, данные ряд можно представить в более удобной, компактной форме:

Это и есть вариационный ряд. Числа, показывающие, сколько раз отдельные варианты встречаются в данной совокупности, называются частотами, или весами, вариант. Они обозначаются строчной буквой латинского алфавита.f i и имеют индекс “i”, соответствующий номеру переменной в вариационном ряду.

Процентное представление частот полезно в тех случаях, когда приходится сравнивать вариационные ряды, сильно различающиеся по объемам. Например, при тестировании школьной готовности детей города, поселка городского типа и села были обследованы выборки детей численностью 1000, 300 и 100 человека соответственно. Различие в объемах выборок очевидно. Поэтому сравнение результатов тестирования лучше проводить, используя проценты частот.

Приведенный выше ряд (3.1) можно представить по другому. Если элементы ряда расположить в возрастающем порядке, то получится так называемый ранжированный вариационный ряд:

Подобная форма представления (3.3) более предпочтительна, чем (3.1), поскольку лучше иллюстрирует закономерность варьирования признака.

Частоты, характеризующие ранжированный вариационный ряд, можно складывать, или накапливать. Накопленные частоты получаются последовательным суммированием значений частот от первой частоты до последней.

В качестве примера вновь обратимся к ряду 3.3. Преобразуем его в ряд 3.4 в котором введем дополнительную строчку и назовем ее «кумуляты частот»:

Рассмотрим подробно как получилась последняя строчка. В начале ряда частот стоит 1. В кумулятивном ряду на втором месте стоит 2 - это сумма первой и второй частоты, т.е. 1 + 1, на третьем месте стоит 4 это сумма второй (уже накопленной частоты) и третьей частоты, т.е. 2 + 2, на четвертом 8 = 4 + 4 и т.д.

Размах (иногда эту величину называют разбросом) выборки обозначается буквой R. Это самый простой показатель, который можно получить для выборки - разность между максимальной и минимальной величинами данного конкретного вариационного ряда, т.е.

Понятно, что чем сильнее варьирует измеряемый признак, тем больше величина R, и наоборот.

Однако может случиться так, что у двух выборочных рядов и средние, и размах совпадают, однако характер варьирования этих рядов будет различный. Например, даны две выборки:

При равенстве средних и разбросов для этих двух выборочных рядов характер их варьирования различен. Для того чтобы более четко представлять характер варьирования выборок, следует обратиться к их распределениям.

Таблицы и графики распределения частот

Как правило, анализ данных начинается с изучения того, как часто встречаются те или иные значения интересующего исследователя признака (переменной) в имеющемся множестве наблюдений. Для этого строятся таблицы и графики распределения частот. Нередко они являются основой для получения ценных содержательных выводов исследования.

Если признак принимает всего лишь несколько возможных значений (до 10-15), то таблица распределения частот показывает частоту встречаемости каждого значения признака. Если указывается, сколько раз встречается каждое значение признака, то это - таблица абсолютных частот распределения, если указывается доля наблюдений, приходящихся на то или иное значение признака, то говорят об относительных частотах распределения.

Во многих случаях признак может принимать множество различных значений, например, если мы измеряем время решения тестовой задачи. В этом случае о распределении признака позволяет судить таблица сгруппированных частот, в которых частоты группируются по разрядам или интервалам значений признака.

Еще одной разновидностью таблиц распределения являются таблицы распределения накопленных частот. Они показывают, как накапливаются частоты по мере возрастания значений признака. Напротив каждого значения (интервала) указывается сумма частот встречаемости всех тех наблюдений, величина признака у которых не превышает данного значения (меньше верхней границы данного интервала). Накопленные частоты содержатся в правых столбцах табл. 3.2 и 3.3.

Для более наглядного представления строится график распределения частот или график накопленных частот - гистограмма или сглаженная кривая распределения.

Гистограмма распределения частот - это столбиковая диаграмма, каждый столбец которой опирается на конкретное значение признака или разрядный интервал (для сгруппированных частот). Высота столбика пропорциональна частоте встречаемости соответствующего значения. На рис. 3.1 изображена гистограмма распределения частот для примера из табл. 3.2.

Гистограмма накошенных частот отличается от гистограммы распределения тем, что высота каждого столбика пропорциональна частоте, накопленной к данному значению (интервалу). На рис. 3.2 изображена гистограмма накопленных частот для данных табл. 3.2.

Построение полигона распределения частот напоминает построение гистограммы. В гистограмме вершина каждого столбца, соответствующая частоте встречаемости данного значения (интервала) признака, - отрезок прямой. А для полигона отмечается точка, соответствующая середине этого отрезка. Далее все точки соединяются ломаной линией (рис. 3.3). Вместо гистограммы или полигона часто изображают сглаженную кривую распределения частот. На рис. 3.4 изображена гистограмма распределения для примера из табл. 3.3 (столбики) и сглаженная кривая того же распределения частот.

Таблицы и графики распределения частот дают важную предварительную информацию о форме распределения признака: о том, какие значения встречаются реже, а какие чаще, насколько выражена изменчивость признака. Обычно выделяют следующие типичные формы распределения. Равномерное распределение – когда все значения встречаются одинаково (или почти одинаково) часто. Симметричное распределение - когда одинаково часто встречаются крайние значения. Нормальное распределение - симметричное распределение, у которого крайние значения встречаются редко и частота постепенно повышается от крайних к серединным значениям признака. Асимметричные распределения - левосторонние (с преобладанием частот малых значений), правосторонние (с преобладанием частот больших значений).

Уже сами по себе таблицы и графики распределения признака позволяют делать некоторые содержательные выводы при сравнении групп испытуемых между собой. Сравнивая распределения, мы можем не только судить о том, какие значения встречаются чаще в той или иной группе, но и сравнивать группы по степени выраженности индивидуальных различий - изменчивости по данному признаку.

Таблицы и графики накопленных частот позволяют быстро получить дополнительную информацию о том, сколько испытуемых (или какая их доля) имеют выраженность признака не выше определенного значения.

Раздел 4. Описательные статистики
(Статистическое распределение и его числовые характеристики)

Переменная может принимать много значений. На начальном этапе обработки данных вместо того, чтобы рассматривать все значения переменной, рекомендуется проанализировать т. к. описательные статистики. Они дают общее представление о значениях или разбросе значений, которые принимает переменная.

К первичным описательным статистикам (Descriptive Statistics) обычно относят числовые характеристики распределения измеренного на выборке признака. Каждая такая характеристика отражает в одном числовом значении свойство распределения множества результатов измерения: с точки зрения их расположения на числовой оси либо с точки зрения их изменчивости. Основное назначение каждой из первичных описательных статистик - замена множества значений признака, измеренного на выборке, одним числом (например, средним значением как мерой центральной тенденции). Компактное описание группы при помощи первичных статистик позволяет интерпретировать результаты измерений, в частности, путем сравнения первичных статистик разных групп.