Математическое ожидание и дисперсия оценок параметров. Точечные оценки математического ожидания

Пусть над случайной величиной с неизвестными математическим ожиданием и дисперсией произведено независимых опытов, давших результаты – . Вычислим состоятельные и несмещенные оценки для параметров и .

В качестве оценки для математического ожидания возьмем среднее арифметическое опытных значений

. (2.9.1)

Согласно закону больших чисел эта оценка является состоятельной , при величина по вероятности. Эта же оценка является и несмещенной , поскольку

. (2.9.2)

Дисперсия этой оценки равна

. (2.9.3)

Можно показать, что для нормального закона распределения эта оценка является эффективной . Для других законов это может быть и не так.

Оценим теперь дисперсию. Выберем сначала для оценки формулу для статистической дисперсии

. (2.9.4)

Проверим состоятельность оценки дисперсии. Раскроем скобки в формуле (2.9.4)

.

При первое слагаемое сходится по вероятности к величине , в второе – к . Таким образом наша оценка сходится по вероятности к дисперсии

,

следовательно, она является состоятельной .

Проверим несмещенность оценки для величины . Для этого подставим в формулу (2.9.4) выражение (2.9.1) и учтем, что случайные величины независимы

,

. (2.9.5)

Прейдем в формуле (2.9.5) к флуктуациям случайных величин

Раскрывая скобки, получим

,

. (2.9.6)

Вычислим математическое ожидание величины (2.9.6), учитывая, что

. (2.9.7)

Соотношение (2.9.7) показывает, что величина , вычисленная по формуле (2.9.4) не является несмещенной оценкой для дисперсии . Ее математическое ожидание не равно, а несколько меньше . Такая оценка приводит к систематической ошибке в сторону уменьшения. Для ликвидации такого смещения нужно ввести поправку, умножив не величину . Тогда такая исправленная статистическая дисперсия может служить несмещенной оценкой для дисперсии

. (2.9.8)

Эта оценка является состоятельной также как и оценка , поскольку при величина .

На практике, вместо оценки (2.9.8) иногда удобнее применять эквивалентную оценку, связанную со вторым начальным статистическим моментом

. (2.9.9)

Оценки (2.9.8), (2.9.9) не являются эффективными. Можно показать, что в случае нормального закона распределения они будут асимптотически эффективными (при будут стремиться к минимально возможному значению).

Таким образом, можно сформулировать следующие правила обработки ограниченного по объему статистического материала. Если в независимых опытах случайная величина принимает значения с неизвестными математическим ожиданием и дисперсией , то для определения этих параметров следует пользоваться приближенными оценками

(2.9.10)

Конец работы -

Эта тема принадлежит разделу:

Конспект лекций по математике теория вероятностей математическая статистика

Кафедра высшей математики и информатики.. конспект лекций.. по математике..

Если Вам нужно дополнительный материал на эту тему, или Вы не нашли то, что искали, рекомендуем воспользоваться поиском по нашей базе работ:

Что будем делать с полученным материалом:

Если этот материал оказался полезным ля Вас, Вы можете сохранить его на свою страничку в социальных сетях:

Все темы данного раздела:

Теория вероятностей
Теория вероятностей – раздел математики, в котором изучаются закономерности случайных массовых явлений. Случайным называется явление, которо

Статистическое определение вероятности
Событием называется случайное явление, которое в результате опыта может появится или не появится (двузначное явление). Обозначают события большими латинскими буквами

Пространство элементарных событий
Пусть с некоторым опытом связано множество событий, причем: 1) в результате опыта появляется одно и только одно

Действия на событиями
Суммой двух событий и

Перестановки
Число различных перестановок из элементов обозначается

Размещения
Размещением из элементов по

Сочетания
Сочетанием из элементов по

Формула сложения вероятностей для несовместных событий
Теорема. Вероятность суммы двух несовместных событий равна сумме вероятностей этих событий. (1

Формула сложения вероятностей для произвольных событий
Теорема. Вероятность суммы двух событий равна сумме вероятностей этих событий без вероятности их произведения.

Формула умножения вероятностей
Пусть даны два события и. Рассмотрим событие

Формула полной вероятности
Пусть – полная группа несовместных событий, их называют гипотезами. Рассмотрим некоторое событие

Формула вероятностей гипотез (Байеса)
Рассмотрим снова – полную группу несовместных гипотез и событие

Асимптотическая формула Пуассона
В тех случаях, когда число испытаний велико, а вероятность появления события

Случайные дискретные величины
Случайной называется величина, которая при повторении опыта может принимать неодинаковые числовые значения. Случайная величина называется дискретной,

Случайные непрерывные величины
Если в результате опыта случайная величина может принимать любое значение из некоторого отрезка или всей действительной оси, то она называется непрерывной. Законо

Функция плотности вероятности случайной непрерывной величины
Пусть. Рассмотрим точку и дадим ей приращени

Числовые характеристики случайных величин
Случайная дискретная или непрерывная величины считаются полностью заданными, если известны их законы распределения. В самом деле, зная законы распределения можно всегда вычислить вероятность попада

Квантили случайных величин
Квантилем порядка случайной непрерывной величины

Математическое ожидание случайных величин
Математическое ожидание случайной величины характеризует ее среднее значение. Все значения случайной величины группируются вокруг этого значения. Рассмотрим сначала случайную дискретную величину

Среднеквадратичное отклонение и дисперсия случайных величин
Рассмотрим сначала случайную дискретную величину. Числовые характеристики мода, медиана, квантили и математическое ожида

Моменты случайных величин
Кроме математического ожидания и дисперсии в теории вероятностей используются числовые характеристики более высоких порядков, которые называются моментами случайных величин.

Теоремы о числовых характеристиках случайных величин
Теорема 1. Математическое ожидание неслучайной величины равно самой этой величине. Доказательство:Пусть

Биномиальный закон распределения

Закон распределения Пуассона
Пусть случайная дискретная величина, принимающая значения

Равномерный закон распределения
Равномерным законом распределения случайной непрерывной величины называется закон функция плотности вероятности, которого

Нормальный закон распределения
Нормальным законом распределения случайной непрерывной величины называется закон функция плотност

Экспоненциальный закон распределения
Экспоненциальное или показательное распределение случайной величины применяется в таких приложениях теории вероятностей, как теория массового обслуживания, теория надежности

Системы случайных величин
На практике в приложениях теории вероятностей часто приходиться сталкиваться с задачами, в которых результаты эксперимента описываются не одной случайной величиной, а сразу несколькими случайными в

Система двух случайных дискретных величин
Пусть две случайные дискретные величины образуют систему. Случайная величина

Система двух случайных непрерывных величин
Пусть теперь систему образуют две случайные непрерывные величины. Законом распределения этой системы называется вероятно

Условные законы распределения
Пусть и зависимые случайные непрерывные велич

Числовые характеристики системы двух случайных величин
Начальным моментом порядка системы случайных величин

Система нескольких случайных величин
Полученные результаты для системы их двух случайных величии могут быть обобщены на случай систем, состоящих из произвольного числа случайных величин. Пусть система образована совокупностью

Нормальный закон распределения системы двух случайных величин
Рассмотрим систему двух случайных непрерывных величин. Законом распределения этой системы является нормальный закон расп

Предельные теоремы теории вероятностей
Основной целью дисциплины теория вероятностей является изучение закономерностей случайных массовых явлений. Практика показывает, что наблюдение массы однородных случайных явлений обнаружив

Неравенство Чебышева
Рассмотрим случайную величину с математическим ожиданием

Теорема Чебышева
Если случайные величины попарно независимы и имеют конечные ограниченные в совокупности дисперсии

Теорема Бернулли
При неограниченном увеличении числа опытов частота появления события сходится по вероятности к вероятности события

Центральная предельная теорема
При сложении случайных величин с любыми законами распределения, но с ограниченными в совокупности дисперсиями, закон расп

Основные задачи математической статистики
Рассмотренные выше законы теории вероятностей представляют собой математическое выражение реальных закономерностей, фактически существующих в различных случайных массовых явлениях. Изучая

Простая статистическая совокупность. Статистическая функция распределения
Рассмотрим некоторую случайную величину, закон распределения которой неизвестен. Требуется на основании опытных данных о

Статистический ряд. Гистограмма
При большом числе наблюдений (порядка сотен) генеральная совокупность становится неудобной и громоздкой для записи статистического материала. Для наглядности и компактности статистический материал

Числовые характеристики статистического распределения
В теории вероятностей рассматривались различные числовые характеристики случайных величин: математическое ожидание, дисперсию, начальные и центральные моменты различных порядков. Аналогичные числов

Выбор теоретического распределения по методу моментов
Во всяком статистическом распределении неизбежно присутствуют элементы случайности, связанные с ограниченностью числа наблюдений. При большом числе наблюдений эти элементы случайности сглаживаются,

Проверка правдоподобия гипотезы о виде закона распределения
Пусть заданное статистическое распределение аппроксимировано некоторой теоретической кривой или

Критерии согласия
Рассмотрим один из наиболее часто применяемых критериев согласия – так называемый критерий Пирсона. Предположи

Точечные оценки для неизвестных параметров распределения
В п.п. 2.1. – 2.7 мы подробно рассмотрели способы решения первой и второй основных задач математической статистики. Это задачи определения законов распределения случайных величин по опытным данным

Доверительный интервал. Доверительная вероятность
На практике при малом числе опытов над случайной величиной приближенная замена неизвестного параметра

ЦЕЛЬ ЛЕКЦИИ: ввести понятие оценки неизвестного параметра распределения и дать классификацию таких оценок; получить точечные и интервальные оценки математического ожидания и дисперсии.

На практике в большинстве случаев закон распределения случайной величины неизвестен, и по результатам наблюдений
необходимо оценить числовые характеристики (например, математическое ожидание, дисперсию или другие моменты) или неизвестный параметр, который определяет закон распределения (плотность распределения)
изучаемой случайной величины. Так, для показательного распределения или распределения Пуассона достаточно оценить один параметр, а для нормального распределения подлежат оценке уже два параметра – математическое ожидание и дисперсия.

Виды оценок

Случайная величина
имеет плотность вероятности
, где– неизвестный параметр распределения. В результате эксперимента получены значения этой случайной величины:
. Произвести оценку по существу означает, что выборочным значениям случайной величины необходимо поставить в соответствие некоторое значение параметра, т. е. создать некоторую функцию результатов наблюдений
, значение которой принимается за оценкупараметра. Индексуказывает на количество проведенных опытов.

Любая функция, зависящая от результатов наблюдений, называется статистикой . Так как результаты наблюдений являются случайными величинами, то и статистика тоже будет случайной величиной. Следовательно, оценку
неизвестного параметраследует рассматривать как случайную величину, а ее значение, вычисленное по экспериментальным данным объемом, – как одно из возможных значений этой случайной величины.

Оценки параметров распределений (числовых характеристик случайной величины) подразделяются на точечные и интервальные. Точечная оценка параметраопределяется одним числом, и ее точность характеризуется дисперсией оценки.Интервальной оценкой называют оценку, которая определяется двумя числами,и– концами интервала, накрывающего оцениваемый параметрс заданной доверительной вероятностью.

Классификация точечных оценок

Чтобы точечная оценка неизвестного параметра
была наилучшей с точки зрения точности, необходимо, чтобы она была состоятельной, несмещенной и эффективной.

Состоятельной называется оценка
параметра, если она сходится по вероятности к оцениваемому параметру, т. е.

. (8.8)

На основании неравенства Чебышева можно показать, что достаточным условием выполнения соотношения (8.8) является равенство

.

Состоятельность является асимптотической характеристикой оценки при
.

Несмещенной называется оценка
(оценка без систематической ошибки), математическое ожидание которой равно оцениваемому параметру, т. е.

. (8.9)

Если равенство (8.9) не выполняется, то оценка называется смещенной. Разность
называется смещением или систематической ошибкой оценки. Если же равенство (8.9) выполняется лишь при
, то соответствующая оценка называется асимптотически несмещенной.

Необходимо отметить, что если состоятельность – практически обязательное условие всех используемых на практике оценок (несостоятельные оценки используются крайне редко), то свойство несмещенности является лишь желательным. Многие часто применяемые оценки свойством несмещенности не обладают.

В общем случае точность оценки некоторого параметра , полученная на основании опытных данных
, характеризуется средним квадратом ошибки

,

который можно привести к виду

,

где –дисперсия,
– квадрат смещения оценки.

Если оценка несмещенная, то

При конечных оценки могут различаться средним квадратом ошибки. Естественно, что, чем меньше эта ошибка, тем теснее группируются значения оценки около оцениваемого параметра. Поэтому всегда желательно, чтобы ошибка оценки была по возможности наименьшей, т. е. выполнялось условие

. (8.10)

Оценку , удовлетворяющую условию (8.10), называют оценкой с минимальным квадратом ошибки.

Эффективной называется оценка
, для которой средний квадрат ошибки не больше среднего квадрата ошибки любой другой оценки, т. е.

где – любая другая оценка параметра.

Известно, что дисперсия любой несмещенной оценки одного параметра удовлетворяет неравенству Крамера – Рао

,

где
– условная плотность распределения вероятностей полученных значений случайной величины при истинном значении параметра.

Таким образом, несмещенная оценка
, для которой неравенство Крамера – Рао обращается в равенство, будет эффективной, т. е. такая оценка имеет минимальную дисперсию.

Точечные оценки математического ожидания и дисперсии

Если рассматривается случайная величина
, имеющая математическое ожиданиеи дисперсию, то оба эти параметра считаются неизвестными. Поэтому над случайной величиной
производитсянезависимых опытов, которые дают результаты:
. Необходимо найти состоятельные и несмещенные оценки неизвестных параметров и.

В качестве оценок иобычно выбираются соответственно статистическое (выборочное) среднее значение и статистическая (выборочная) дисперсия:

; (8.11)

. (8.12)

Оценка математического ожидания (8.11) является состоятельной согласно закону больших чисел (теорема Чебышева):

.

Математическое ожидание случайной величины

.

Следовательно, оценка является несмещенной.

Дисперсия оценки математического ожидания:

Если случайная величина
распределена по нормальному закону, то оценкаявляется также и эффективной.

Математическое ожидание оценки дисперсии

В то же время

.

Так как
, а
, то получаем

. (8.13)

Таким образом,
– смещенная оценка, хотя является состоятельной и эффективной.

Из формулы (8.13) следует, что для получения несмещенной оценки
следует видоизменить выборочную дисперсию (8.12) следующим образом:

которая считается "лучшей" по сравнению с оценкой (8.12), хотя при больших эти оценки практически равны друг другу.

Методы получения оценок параметров распределения

Часто на практике на основании анализа физического механизма, порождающего случайную величину
, можно сделать вывод о законе распределения этой случайной величины. Однако параметры этого распределения неизвестны, и их необходимо оценить по результатам эксперимента, обычно представленных в виде конечной выборки
. Для решения такой задачи чаще всего применяются два метода: метод моментов и метод максимального правдоподобия.

Метод моментов . Метод состоит в приравнивании теоретических моментов соответствующим эмпирическим моментам того же порядка.

Эмпирические начальные моменты -го порядка определяются формулами:

,

а соответствующие им теоретические начальные моменты -го порядка – формулами:

для дискретных случайных величин,

для непрерывных случайных величин,

где – оцениваемый параметр распределения.

Для получения оценок параметров распределения, содержащего два неизвестных параметра и, составляется система из двух уравнений

где и– теоретический и эмпирический центральные моменты второго порядка.

Решением системы уравнений являются оценки инеизвестных параметров распределенияи.

Приравняв теоретический эмпирический начальные моменты первого порядка, получаем, что оценкой математического ожидания случайной величины
, имеющей произвольное распределение, будет выборочное среднее, т. е.
. Затем, приравняв теоретический и эмпирический центральные моменты второго порядка, получим, что оценка дисперсии случайной величины
, имеющей произвольное распределение, определяется формулой

.

Подобным образом можно найти оценки теоретических моментов любого порядка.

Метод моментов отличается простотой и не требует сложных вычислений, но полученные этим методом оценки часто являются неэффективными.

Метод максимального правдоподобия . Метод максимального правдоподобия точечной оценки неизвестных параметров распределения сводится к отысканию максимума функции одного или нескольких оцениваемых параметров.

Пусть
– непрерывная случайная величина, которая в результатеиспытаний приняла значения
. Для получения оценки неизвестного параметранеобходимо найти такое значение, при котором вероятность реализации полученной выборки была бы максимальной. Так как
представляют собой взаимно независимые величины с одинаковой плотностью вероятности
, тофункцией правдоподобия называют функцию аргумента :

Оценкой максимального правдоподобия параметра называется такое значение, при котором функция правдоподобия достигает максимума, т. е. является решением уравнения

,

которое явно зависит от результатов испытаний
.

Поскольку функции
и
достигают максимума при одних и тех же значениях
, то часто для упрощения расчетов используют логарифмическую функцию правдоподобия и ищут корень соответствующего уравнения

,

которое называется уравнением правдоподобия .

Если необходимо оценить несколько параметров
распределения
, то функция правдоподобия будет зависеть от этих параметров. Для нахождения оценок
параметров распределения необходимо решить системууравнений правдоподобия

.

Метод максимального правдоподобия дает состоятельные и асимптотически эффективные оценки. Однако получаемые методом максимального правдоподобия оценки бывают смещенными, и, кроме того, для нахождения оценок часто приходится решать достаточно сложные системы уравнений.

Интервальные оценки параметров

Точность точечных оценок характеризуется их дисперсией. При этом отсутствуют сведения о том, насколько близки полученные оценки истинным значениям параметров. В ряде задач требуется не только найти для параметра подходящее численное значение, но и оценить его точность и надежность. Необходимо узнать, к каким ошибкам может привести замена параметраего точечной оценкойи с какой степенью уверенности следует ожидать, что эти ошибки не выйдут за известные пределы.

Такие задачи особенно актуальны при малом числе опытов , когда точечная оценкав значительной степени случайна и приближенная заменанаможет привести к значительным ошибкам.

Более полный и надежный способ оценивания параметров распределений заключается в определении не единственного точечного значения, а интервала, который с заданной вероятностью накрывает истинное значение оцениваемого параметра.

Пусть по результатам опытов получена несмещенная оценка
параметра. Необходимо оценить возможную ошибку. Выбирается некоторая достаточно большая вероятность
(например), такая, что событие с этой вероятностью можно считать практически достоверным событием, и находится такое значение, для которого

. (8.15)

В этом случае диапазон практически возможных значений ошибки, возникающей при замене на, будет
, а большие по абсолютной величине ошибки будут появляться лишь с малой вероятностью.

Выражение (8.15) означает, что с вероятностью
неизвестное значение параметрапопадет в интервал

. (8.16)

Вероятность
называетсядоверительной вероятностью , а интервал, накрывающий с вероятностьюистинное значение параметра, называетсядоверительным интервалом . Заметим, что неправильно говорить, что значение параметра лежит внутри доверительного интервала с вероятностью. Используемая формулировка (накрывает) означает, что хотя оцениваемый параметр и неизвестен, но он имеет постоянное значение и, следовательно, не имеет разброса, поскольку это не случайная величина.

Оценки математического ожидания и дисперсии.

С понятием параметров распределения мы познакомились в теории вероятностей. Например, в нормальном законе распределения, задаваемом функцией плотности вероятности

параметрами служат а – математическое ожидание и а – среднее квадратическое отклонение. В распределении Пуассона параметром является число а = пр.

Определение. Статистической оценкой неизвестного параметра теоретического распределения называют его приближенное значение, зависящее от данных выборки (х 1 , х 2 , х 3 , ..., х k ; п 1 , п 2 , п 3 , ..., п k ), т. е. некоторую функцию этих величин.

Здесь х 1 , х 2 , х 3 , ..., х k – значения признака, п 1 , п 2 , п 3 , ..., п k –соответствующие частоты. Статистическая оценка является случайной величиной.

Обозначим через θ – оцениваемый параметр, а через θ * – его статистическую оценку. Величину |θ *–θ | называют точностью оценки. Чем меньше |θ *–θ |, тем лучше, точнее определен неизвестный параметр.

Чтобы оценка θ * имела практическое значение, она не должна содержать систематической ошибки и вместе с тем иметь возможно меньшую дисперсию. Кроме того, при увеличении объема выборки вероятность сколь угодно малых отклонений |θ *–θ | должна быть близка к 1.

Сформулируем следующие определения.

1. Оценка параметра называется несмещенной, если ее математическое ожидание М (θ *) равно оцениваемому параметру θ , т. е.

М (θ *) = θ, (1)

и смещенной, если

М (θ *) ≠ θ, (2)

2. Оценка θ* называется состоятельной, если при любом δ > 0

(3)

Равенство (3) читается так: оценка θ * сходится по вероятности к θ .

3. Оценка θ* называется эффективной, если при заданном п она имеет наименьшую дисперсию.

Теорема 1. Выборочная средняя Х В является несмещенной и состоятельной оценкой математического ожидания.

Доказательство. Пусть выборка репрезентативна, т. е.. все элементы генеральной совокупности имеют одинаковую возможность попасть в выборку. Значения признака х 1 , х 2 , х 3 ,...,х n можно принять за независимые случайные величины Х 1 , Х 2 , Х 3 , ...,Х n с одинаковыми распределениями и числовыми характеристиками, в том числе с равными математическими ожиданиями, равными а,

Так как каждая из величин Х 1 , Х 2 , Х 3 , …, Х п имеет распределение, совпадающее с распределением генеральной совокупности, то М (Х ) = а. Поэтому

откуда следует, что – состоятельная оценка М (Х ).

Используя правило исследования на экстремум, можно доказать, что является и эффективной оценкой М (Х ).

Необходимость оценивания математического ожидания по результатам испытаний появляется в задачах, когда результат эксперимента описывается случайной величиной и показателем качества исследуемого объекта принято математическое ожидание этой случайной величины. Например, в качестве показателя надежности может быть принято математическое ожидание времени безотказной работы какой-либо системы, а при оценивании эффективности производства продукции - математическое ожидание числа годных изделий и т. д.

Задача оценивания математического ожидания формулируется следующим образом. Предположим, что для определения неизвестного значения случайной величины X предполагается произвести п независимых и свободных от систематических ошибок измерений X v Х 2 ,..., Х п. Требуется выбрать наилучшую оценку математического ожидания.

Наилучшей и наиболее распространенной на практике оценкой математического ожидания является среднее арифметическое результатов испытаний

называемое также статистическим или выборочным средним.

Покажем, что оценка т х удовлетворяет всем требованиям, предъявляемым к оценке любого параметра.

1. Из выражения (5.10) следует, что

т. е. оценка т" х - несмещенная оценка.

2. Согласно теореме Чебышева среднее арифметическое результатов испытаний сходится по вероятности к математическому ожиданию, т. е.

Следовательно, оценка (5.10) есть состоятельная оценка математического ожидания.

3. Дисперсия оценки т х, равная

с ростом объема выборки п неограниченно убывает. Доказано, что если случайная величина X подчинена нормальному закону распределения, то при любом п дисперсия (5.11) будет минимально возможной, а оценка т х - эффективной оценкой математического ожидания. Знание дисперсии оценки позволяет вынести суждение относительно точности определения неизвестного значения математического ожидания с помощью этой оценки.

В качестве оценки математического ожидания среднее арифметическое используется в том случае, если результаты измерений равноточные (дисперсии D, i = 1, 2, ..., п одинаковы в каждом измерении). Однако на практике приходится сталкиваться с задачами, в которых результаты измерений неравноточные (например, в процессе испытаний измерения производятся различными приборами). В этом случае оценка для математического ожидания имеет вид

где - вес г-го измерения.

В формулу (5.12) результат каждого измерения включается со своим весом С .. Поэтому оценку результатов измерений т х называют средневзвешенной.

Можно показать, что оценка (5.12) является несмещенной, состоятельной и эффективной оценкой математического ожидания. Минимальная дисперсия оценки определяется выражением


При проведении экспериментов с моделями на ЭВМ подобные задачи возникают в том случае, когда оценки находят по результатам нескольких серий испытаний и число испытаний в каждой серии различно. Например, проведены две серии испытаний объемом п 1 и п 2 , по результатам которых получены оценки т хi и т х _. С целью повышения точности и достоверности определения математического ожидания результаты этих серий испытаний объединяют. Для этого следует воспользоваться выражением (5.12)

При вычислении коэффициентов С вместо дисперсий D подставляют их оценки, полученные по результатам испытаний в каждой серии.

Аналогичный подход используют и при определении вероятности наступления случайного события по результатам серий испытаний.

Для оценивания математического ожидания случайной величины X, кроме выборочного среднего, могут использоваться и другие статистики. Чаще всего для этих целей используют члены вариационного ряда, т. е. порядковые статистики , на базе которых строят оценки,

удовлетворяющие основным из предъявляемых требований, а именно состоятельности и несмещенности.

Предположим, что вариационный ряд содержит п = 2к членов. Тогда в качестве оценки математического ожидания может быть принято любое из средних:

При этом к-е среднее

есть не что иное, как статистическая медиана распределения случайной величины X, поскольку имеет место очевидное равенство

Преимущество статистической медианы состоит в том, что она свободна от влияния аномальных результатов наблюдений, неизбежного при использовании первого среднего, т. е. среднего из наименьшего и наибольшего числа вариационного ряда.

При нечетном объеме выборки п = - 1 статистической медианой является ее средний элемент, т. е. к -й член вариационного ряда Me = х к.

Существуют распределения, у которых среднее арифметическое не является эффективной оценкой математического ожидания, например, распределение Лапласа. Можно показать, что для распределения Лапласа эффективной оценкой математического ожидания является выборочная медиана.

Доказано, что если случайная величина X имеет нормальное распределение, то при достаточно большом объеме выборки закон распределения статистической медианы близок к нормальному с числовыми характеристиками

Из сравнения формул (5.11) и (5.14) следует, что дисперсия статистической медианы в 1,57 раза больше дисперсии среднего арифметического. Следовательно, среднее арифметическое как оценка математического ожидания во столько же раз эффективнее статистической медианы. Однако из-за простоты вычислений, нечувствительности к аномальным результатам измерений (“засоренности” выборки) на практике в качестве оценки математического ожидания тем не менее используют статистическую медиану.

Следует отметить, что для непрерывных симметричных распределений математическое ожидание и медиана совпадают. Поэтому статистическая медиана может служить хорошей оценкой математического ожидания лишь при симметричном распределении случайной величины.

Для несимметричных распределений статистическая медиана Me имеет существенное смещение относительно математического ожидания, поэтому для его оценивания непригодна.

Пусть имеется случайная величина X, и ее параметры математическое ожидание а и дисперсия неизвестны. Над величиной X произведеноn независимых опытов, давших результаты x 1, x 2, x n .

Не уменьшая общности рассуждений, будем считать эти значения случайной величины различными. Будем рассматривать значения x 1, x 2, x n как независимые, одинаково распределенные случайные величины X 1, X 2, X n .

Простейший метод статистического оценивания - метод подстановки и аналогии - состоит в том, что в качестве оценки той или иной числовой характеристики (среднего, дисперсии и др.) генеральной совокупности берут соответствующую характеристику распределения выборки - выборочную характеристику.

По методу подстановки в качестве оценки математического ожидания а надо взять математическое ожидание распределения выборки - выборочное среднее. Таким образом, получаем

Чтобы проверить несмещенность и состоятельность выборочного среднего как оценки а , рассмотрим эту статистику как функцию выбранного вектора (X 1, X 2, X n). Приняв во внимание, что каждая из величин X 1, X 2, X n имеет тот же закон распределения, что и величина X, заключаем, что и числовые характеристики этих величин и величины X одинаковые: M(X i ) = M(X) = a , D(X i ) = D(X) = , i = 1, 2, n, причем X i - независимые в совокупности случайные величины.

Следовательно,

Отсюда по определению получаем, что - несмещенная оценка а , и так как D()®0 при n®¥, то в силу теоремы предыдущего параграфа является состоятельной оценкой математического ожидания а генеральной совокупности.

Эффективность или неэффективность оценки зависит от вида закона распределения случайной величины X. Можно доказать, что если величина X распределена по нормальному закону, то оценка является эффективной. Для других законов распределения это может быть не так.

Несмещенной оценкой генеральной дисперсии служит исправленная выборочная дисперсия

,

Так как , где - генеральная дисперсия. Действительно,

Оценка s -- 2 для генеральной дисперсии является также и состоятельной, но не является эффективной. Однако в случае нормального распределения она является «асимптотически эффективной», то есть при увеличении n отношение ее дисперсии к минимально возможной неограниченно приближается к единице.

Итак, если дана выборка из распределения F(x ) случайной величины X с неизвестным математическим ожиданием а и дисперсией , то для вычисления значений этих параметров мы имеем право пользоваться следующими приближенными формулами:

a ,

.

Здесь x- i - - варианта выборки, n- i - - частота варианты x i , - - объем выборки.
Для вычисления исправленной выборочной дисперсии более удобна формула


.

Для упрощения расчета целесообразно перейти к условным вариантам (в качестве с выгодно брать первоначальную варианту, расположенную в середине интервального вариационного ряда). Тогда

, .

Интервальное оценивание

Выше мы рассмотрели вопрос об оценке неизвестного параметра а одним числом. Такие оценки мы назвали точечными. Они имеют тот недостаток, что при малом объеме выборки могут значительно отличаться от оцениваемых параметров. Поэтому, чтобы получить представление о близости между параметром и его оценкой, в математической статистике вводятся, так называемые, интервальные оценки.

Пусть во выборке для параметра q найдена точечная оценка q * . Обычно исследователи заранее задаются некоторой достаточно большой вероятностью g (например, 0,95; 0,99 или 0,999) такой, что событие с вероятностью g можно считать практически достоверным, и ставят вопрос об отыскании такого значения e > 0, для которого

.

Видоизменив это равенство, получим:

и будем в этом случае говорить, что интервал ]q * - e; q * + e[ покрывает оцениваемый параметр q с вероятностью g.

Интервал ]q * -e; q * +e [ называется доверительным интервалом .

Вероятность g называется надежностью (доверительной вероятностью) интервальной оценки.

Концы доверительного интервала, т.е. точки q * -e и q * +e называются доверительными границами .

Число e называется точностью оценки .

В качестве примера задачи об определении доверительных границ, рассмотрим вопрос об оценке математического ожидания случайной величины Х, имеющей нормальный закон распределения с параметрами а и s, т.е. Х = N(a , s). Математическое ожидание в этом случае равно а . По наблюдениям Х 1 , Х 2 , Х n вычислим среднее и оценку дисперсии s 2 .

Оказывается, что по данным выборки можно построить случайную величину

которая имеет распределение Стьюдента (или t-распределение) с n = n -1 степенями свободы.

Воспользуемся таблицей П.1.3 и найдем для заданных вероятности g и числа n число t g такое, при котором вероятность

P(|t(n)| < t g) = g,

.

Сделав очевидные преобразования получим,

Порядок применения F-критерия следующий:

1. Принимается предположение о нормальности распределения генеральных совокупностей. При заданном уровне значимости a формулируется нулевая гипотеза Н 0: s х 2 = s y 2 о равенстве генеральных дисперсий нормальных совокупностей при конкурирующей гипотезе Н 1: s х 2 > s y 2 .

2. Получают две независимые выборки из совокупностей Х и Y объемом n x и n y соответственно.

3. Рассчитывают значения исправленных выборочных дисперсий s х 2 и s y 2 (методы расчета рассмотрены в §13.4). Большую из дисперсий (s х 2 или s y 2) обозначают s 1 2 , меньшую - s 2 2 .

4. Вычисляется значение F-критерия по формуле F набл = s 1 2 / s 2 2 .

5. По таблице критических точек распределения Фишера - Снедекора, по заданному уровню значимости a и числом степеней свободы n 1 = n 1 - 1, n 2 = n 2 - 1 (n 1 - число степеней свободы большей исправленной дисперсии), находится критическая точка F кр (a, n 1 , n 2).

Отметим, что в таблице П.1.7 приведены критические значения одностороннего F-критерия. Поэтому, если применяется двусторонний критерий (Н 1: s х 2 ¹ s y 2), то правостороннюю критическую точку F кр (a/2, n 1 , n 2) ищут по уровню значимости a/2 (вдвое меньше заданного) и числам степеней свободы n 1 и n 2 (n 1 - число степеней свободы большей дисперсии). Левостороннюю критическую точку можно и не отыскивать.

6. Делается вывод: если вычисленное значение F-критерия больше или равно критическому (F набл ³ F кр), то дисперсии различаются значимо на заданном уровне значимости. В противном случае (F набл < F кр) нет оснований для отклонения нулевой гипотезы о равенстве двух дисперсий.

Задача 15.1 . Расход сырья на единицу продукции по старой технологии составил:

По новой технологии:

Предположив, что соответствующие генеральные совокупности X и Y имеют нормальные распределения, проверить, что по вариативности расход сырья по новой и старой технологиям не отличаются, если принять уровень значимости a = 0,1.

Решение . Действуем в порядке, указанном выше.

1. Будем судить о вариативности расхода сырья по новой и старой технологиям по величинам дисперсий. Таким образом, нулевая гипотеза имеет вид Н 0: s х 2 = s y 2 . В качестве конкурирующей примем гипотезу Н 1: s х 2 ¹ s y 2 , поскольку заранее не уверены в том, что какая-либо из генеральных дисперсий больше другой.

2-3. Найдем выборочные дисперсии. Для упрощения вычислений перейдем к условным вариантам:

u i = x i - 307, v i = y i - 304.

Все вычисления оформим в виде следующих таблиц:

u i m i m i u i m i u i 2 m i (u i +1) 2 v i n i n i v i n i v i 2 n i (v i +1) 2
-3 -3 -1 -2
å -
å -

Контроль: å m i u i 2 + 2å m i u i + m i = Контроль: å n i v i 2 + 2å n i v i + n i = 13 + 2 + 9 = 24 = 34 + 20 + 13 = 67

Найдем исправленные выборочные дисперсии:

4. Сравним дисперсии. Найдем отношение большей исправленной дисперсии к меньшей:

.

5. По условию конкурирующая гипотеза имеет вид s х 2 ¹ s y 2 , поэтому критическая область двусторонняя и при отыскании критической точки следует брать уровни значимости, вдвое меньше заданного.

По таблице П.1.7 по уровню значимости a/2 = 0,1/2 = 0,05 и числам степеней свободы n 1 = n 1 - 1 = 12, n 2 = n 2 - 1 = 8 находим критическую точку F кр (0,05; 12; 8) = 3,28.

6. Так как F набл. < F кр то гипотезу о равенстве дисперсий расхода сырья при старой и новой технологиях принимаем.

Выше при проверке гипотез предполагалось нормальность распределения исследуемых случайных величин. Однако специальные исследования показали, что предложенные алгоритмы весьма устойчивы (особенно при больших объемах выборок) по отношению к отклонению от нормального распределения.