0: Здравствуйте, дорогие участники проекта открытый университет. Меня зовут Ежова Марина Алексеевна. И сегодня я вам расскажу про интересный раздел математики. Математическая статистика, как вы знаете.
1: Слово статистика чаще всего применяется к подсчётам каких-то цифр, чисел нахождение неких числовых характеристик, какого-либо набора объектов. Мы с вами рассмотрим самые простые поня.
2: Математической статистики. Итак, допустим, у нас имеется несколько объектов, которые нам хотелось бы изучить, например, леса с деревьями или, возможно, гвозди в ящиках.
3: Или просто люди на улицах, их очень много, и нам нужно понять, какие характеристики можно описать в каждом из них.
4: Рассматривать абсолютно все объекты, исследовать их было бы крайне затратно. То есть, если у нас много объектов, десятки, сотни, 1000, сотни тысяч, если объекты связаны.
5: Если исследование объекта связано с значительными затратами, например, денежными затратами на исследование каждого отдельного объекта, или если при исследовании объект уничтожается, ну, чтобы прове,
6: Kinder surprise его надо вскрыть полностью, тем самым уничтожив его внешний вид, то в каждом из этих случаев вместо исследования абсолютно всего набора объектов так называемой генеральной совокупности.
7: Мы будем исследовать лишь некоторые из них, то есть выборочную совокупность или выборку. Итак, генеральная совокупность это совокупность всех объектов, из которых проводится выборка, то есть все то множество.
8: Которую надо изучить. Выборочная совокупность это совокупность случайно отобранных объектов из этой генеральной совокупности.
9: Соответственно, объём генеральной совокупности должен быть намного больше, объём это количество объектов, а объём выборки значительно меньше, но при этом этот объём не должен быть очень мал.
10: Иначе выборка не будет представительна.
11: Итак, как же можно производить выборку объектов? Для этого определили несколько подходов. 1 комплект подход называется вероятностные выборки. То есть, вероятно,
12: Способ другой, соответственно невероятностный к вероятностным способам описывают 3 случая 1 случайная выборка, самый простой способ подбора.
13: Мы предполагаем однородность генеральной совокупности и одинаковую вероятность того, что каждый объект генеральной совокупности может попасть в выборку, в частности, может использоваться таблица.
14: Случайных чисел. Если у вас объекты упорядочены и пронумерованы, сюда относятся так называемые генераторы случайных имён, фамилий, слов, лозунгов и так далее. 2, 2 подход это механизм
15: Или систематическая выборка. Мы предполагаем, что все объекты генеральной совокупности у нас упорядочены, например, по алфавиту, если это люди или название, возможно, пронумерованы все.
16: Ящики гвоздей и так далее. Мы случайным способом выбираем 1 объект и после с некоторым шагом определяем каждый последую
17: Объект для выборки, то есть для примера, на экране это шаг равен 10, то есть между номерами ящиков Ровно 10. 3 вариант вероятностной выборки это стратифицированные или
18: Районированная выборка предполагается в этом случае, что генеральная совокупность у нас неоднородна, то есть есть отдельные группы или страты объектов, то есть мы делим все объекты на эти группы.
19: На эти страты и уже из каждой группы выбираем несколько объектов для исследования. Последний из рассматриваемых нами вариантов выборки это серийное
20: Или кластерная выборка, она также относится к вероятностным. В этом случае мы выбираем не конкретный объект из множества объектов, а мы делим все объекты на группы, как и сертифицированы.
21: Выборки, но при этом мы исследуем абсолютно все объекты какой-то группы. То есть как вот предложено в примере контрольный будет писать какой-то 1 класс из всей параллели. То есть пишут все
22: В ней, а не только несколько человек. Это были вероятностные варианты выборки. Теперь перейдём к невероятностный. Их тоже обычно выделяют 4 штуки. Так, 1 вариант это квот.
23: Выборка со словом квота вы наверняка уже встречались, только это некоторый процент, который некоторая обязательная часть, которая должна быть в целом.
24: То есть квотная выборка связана с тем, что мы опять же делим генеральную совокупность на несколько групп, и из каждой группы мы берём по обязательному количеству объектов, то есть
25: В отличие от серийной или стратифицированной выборки, это количество объектов либо пропорционально объёму.
26: Либо выборки, либо равное количество из каждого из каждой группы мы забираем 2 вариант невероятностной выборки именуется снежный
27: Классический вариант это сетевой маркетинг. То есть представим ситуацию. Вам нужно найти какой-нибудь эксклюзивный объект, какую-нибудь, например,
28: Фигурку или ещё какую-нибудь замечательную вещь, которую вы готовы купить. Вы знаете примерно людей, которые могут вам в этом помочь. То есть вряд ли у них самих есть, но у них есть могут быть знакомые, вы
29: К 1 Такому человеку спрашиваете, есть ли у них, знают ли они про нужную вам фигурку. Возможно, вы можете её описать и так далее, и они дают вам контакты других людей, которые тоже могут
30: Могут вам помочь в ваших поисках. Последовательно переходите ко 2 человеку. Он даёт следующие контакты людей к 3, и он тоже даёт контакты к 4, к 5. Да, некоторые контакты, естественно, могут быть одинаковыми у разных людей.
31: Но таким образом вы ширите и ширите сеть для своих опросов. То есть вот классический вариант. Следующий вариант выборки стихийная, это сейчас достаточно
32: Часто используемые всевозможные интернет опросы, google формы и так далее задаётся некоторый вопрос, и он отправляется на просторы.
33: Интернет ресурсов, кто отвечает, насколько правильно отвечают, ответственно ли отвечают. Вы этого ничего не знаете. То есть вы заранее не предполагаете, кто будет отвечать на ваш вопрос. Вы лишь можете, фикси.
34: Результаты ваших опросов, поэтому характеристика данной выборки в том, что заранее неизвестен ни состав, ни размер выборки.
35: И, наконец, 4 вариант выборка типичных случаев. Она предполагает, что мы в качестве нашей цели рассмотрения объекта выборки выбираем тех, у кого име
36: Имеется некоторый стандартный или типичный уровень некоторого значения, то есть конкретный рост или вес там, или средняя оценка в четверти и уже эти
37: Людей мы опрашиваем по какому-либо 2 признаку. Также выделяют так называемые зависимые и независимые выборки. Но это когда мы уже сделали несколько выборок из генеральной совокупности и
38: Если 1 выбор показатели 1 выборки и 2 выборки связаны друг с другом каким-либо образом, то они называются зависимыми, а если не связанными, то называются независимыми.
39: Итак, это мы посмотрели, как можно выбирать объекты, но для выборки.
40: Необходимо с этой выборкой мы дальше начнём заниматься вычислениями. Что для этого нужно? Так вот, приведём замечательный пример. Нам даны список
41: Количество пропусков у 25 студентов.
42: То есть то, что мы видим, это 25 студентов, это может быть генеральная выборка. То есть у нас всего 25 студентов, это может быть уже выборка по какому-либо кри.
43: Признаку. То есть, возможно, у нас было 600 студентов, а мы выбрали только 25. Это могут быть студенты только 1 курса, только 2 курса или, например, только высокие студенты, или только опаздывающие студенты.
44: Как бы то ни было, по некоторому критерию мы выбрали 25 студентов, и вот у нас есть 25 чисел, которые показывают нам количество пропусков за неделю у них этот первоначальный набор значений.
45: Именуется статистическим рядом.
46: Если мы выпишем по возрастанию, по 1 представителю из этого ряда, то есть как очевидно, что тут только целые числа начинаются от нуля заканчиваются. 6 тут нет - 1 или
47: 7, 8, 9. Так вот, если мы пропишем
48: Уникальные значения по порядку, по возрастанию или по убыванию этот ряд тогда называется вариационным. То есть он содержит варианты, причём варианты не от слова варианты. Он
49: От слова варианта она, да, вот такое интересное слово следующим. То есть это достаточно обычный, стандартный вариант, что можно сделать так, 1 число, которое мы можем
50: Распознать это размах выборки. То есть мы берём самое маленькое количество из этого ряда и самое большое разница между ними есть наш размах.
51: Записывать постоянно 25 чисел это проблематично, поэтому их можно оформить в виде таблицы, где мы указываем каждую варианту и чистоту этой.
52: Варианты частота, то есть количество раз, которое она повторяется, такая таблица именуется статистическое распределение выборки.
53: По этой таблице можно построить графики для статистических распределений обычно имеются 2 вида графиков. Итак.
54: И кумулятор да, забавное название, слово полигон обозначает ломанную, где координатами точек являются значения нашей варианты и её час.
55: Частота, то есть обычная табличка икс игрек, но только вместо игрека у вас частоты и полигон это такая ломанная, из отрезочков кумулятор. Кумулятор само по себе.
56: Главное слово и, как вы видите, это тоже ломаная, но почему-то она другая. Чтобы построить кумуляту, необходимо вычислить накопительные частоты, то есть
57: Вот в нашей табличке имеет, появилась 3 строчка, где мы постепенно складываем все частоты.
58: Нолик повторяется у нас 7 раз. Единичка у нас 4 7 + 4. Получилось 11. Дальше добавляем 3 раза повторённую двоечку и уже у нас 14 дальше.
59: 19, 21, 23 и 25.
60: То есть постепенно у нас возрастает это значение до общего количества всех частот. 25. У нас 25 чисел. Итоговое число 25. Кумулятор это вариация. Графика из
61: Теория вероятности там тоже есть такие замечательные, случайные величины, и среди прочего у них есть у случайных величин есть непрерывные случайные величины и график функции непрерывной случайной величины.
62: В целом похож на кумулятор, то есть статистика и теория вероятности в этом разделе, в разделе как раз выборок и их числовых характеристик. Крайне похоже так.
63: Кроме графиков, естественно, нужно что-нибудь ещё и посчитать, какие же существуют у нас числовые характеристики для простейших выборок.
64: Итак, вот наши 25 чисел и наше статистическое распределение этих чисел 1, что мы можем определить, это статистическая мода статистической модой назы.
65: Число, то есть значение нашей величины, которое повторяется наибольшее количество раз. Для нашего примера больше всего повторяется нолик целых 7 раз.
66: Этот нолик и будет нашей статистической модой, если в распределении указаны несколько, то есть с одинаковым наибольшим количеством частот несколько таких значений, то, значит, у этого
67: Будет несколько мод, мода, 1, 2, 3 и так далее. Чтобы определить 2 понятие статистическая медиана, можно пойти сразу несколькими путями в 1 очередь.
68: Мы можем упорядочить весь наш статистический ряд. Вот наши 25 чисел по порядку распределены, и тогда статистической медианной будет число Ровно по центру данного ряда у нас
69: 25 чисел. Значит, центральный элемент имеет номер 13. Если посчитать слева или справа, то на 13 числе вы попадёте в нашу центральную двоечку также
70: Статистическую медиану можно определять, например, по таблице с накопительными частотами, потому что как раз строчкой, где указаны накопительные частоты, по факту прописаны.
71: Номер последнего наименования этой частоты в ряде, то есть нолики, у нас от 1 до 7 единички уже от 8 до 11 двойки.
72: От 12 до 14. То есть это их номера в нашем списке кому-то проще упорядочивать ряд, кому-то проще посчитать по таблице, так это были 2 характеристики.
73: Который достаточно просто определить. Идём дальше.
74: Выборочное среднее выглядит очень страшно выборочное среднее это на самом деле среднее арифметическое всех полученных значений. То есть мы
75: Должны сложить все наши 25 чисел и поделить на общее количество если чисел у нас изначально меньше, то есть те же самые оценки за четверть или, например, за контрольные их устно склады.
76: Делит на количество, иногда с калькулятором и получается как раз среднее арифметическое среднее. Так вот, выборочное, среднее тоже самое. Здесь представлены сразу несколько вариантов, то есть по определению все сумме.
77: Делим на количество или g2 формула с 2 сигмой мы используем тот факт, что часть наших значений повторяется, поэтому нет смысла складывать 3
78: Раза двойки, если мы можем 3 * 2, это будет и быстрее, и короче, посчитав таким образом наши замечательные значения.
79: Подставив как раз во 2 формулу, мы получаем некоторое число 2,2. То есть у нас имеется 2,2 в среднем прогула из наших 25 студентов. Кому
80: Это, кажется, много кому-то кажется мало, но в данном случае это так. Если количество студентов с прогулами у нас увеличится, то есть, например, вместо 7 раз Ноликов нолик повторит.
81: У нас только 6 или 5 раз. И эти, соответственно, дополнительные студенты куда-нибудь переместятся в 6 прогулов, в 2 прогула, то выборочная, средняя, естественно, у нас будет увеличиваться.
82: Это, это было легко. Дальше пойдёт намного интереснее. Следующая числовая характеристика, выборочная дисперсия, да, вот тут уже пошли какие-то квадраты, суммы, скобки.
83: Итак, выборочная дисперсия по определению, это среднее арифметическое квадратов отклонения полученных значений от выборочного среднего, да.
84: Интересное наименование. Давайте с вами по факту посмотрим, что происходит. Итак, у нас есть выборочное среднее, мы должны из каждого значения x вычесть это самое среднее 2,2, то есть
85: Эту разность потом возвести в квадрат и разделить на общее количество на 25. То есть, когда мы из наших значений вычитаем 2,2 часть
86: У нас значение будет положительное. То есть, если мы из 3, из 4, из 5 будем вычитать это число, а часть будет отрицательная, если мы вычитаем из нолика, из 1 или из 2, и чтобы при суммировании как раз эти
87: Отрицательные и положительные разности взаимно не уничтожились. Мы и возводим разность в квадрат. То есть дисперсия нам помогает смотреть на объём, на размерность отклонения от среднего, то есть
88: Если отклонение от среднего большое, то, соответственно, размах, разлёт наших значений тоже существенный, если же отклонение от выборочного
89: Среднего небольшой. Значит, большая часть значений сосредоточена как раз рядышком с этим средним. Итак, определение мы с вами описали. Также вариация
90: Сигме есть если мы используем одни и те же значения по иксам, соответственно, их можно умножать на количество повторов, но, как указано ниже, появляется какая-то 2.
91: Формула, которая также описывает нам выборочную дисперсию, это 2 формула, то есть выборочная, средняя от квадрата минус квадрат выборочного среднего позволяет нам более компактно.
92: Вычислить выборочную дисперсию можно вычислять по определению и многие этим пользуются, но лично для мне проще как раз вот этой 2 практической формулой, чтобы её использовать у нас
93: Выборочная средняя уже есть 2,2. Осталось найти икс в квадрате. Выборочное. Среднее. Для этого мы поступаем точно так же, как в предыдущей табличке, но в начале мы возводим икс в квадрат и
94: Умножаем икс квадрат на как раз наши частоты умножать можно уже в записи, в скобках, как это было показано на экране, можно умножать в таблице и тогда просто найти
95: Сумму последней строчки, заканчивающейся на 72. То есть сумма этой строки, как и сумма в скобках, равна 215, и при делении на общее количество 25 мы получаем 8,6.
96: Осталось для нахождения дисперсии. Из этого числа вычесть квадрат 2,2. Вычитаем и получаем некоторое число 3,76. То есть это как
97: Странно количество прогулов в квадрате.
98: Странная единица измерения прогулов в квадрате к квадратным метрам вы уже привыкли в своей жизни к квадратным килограммам, физике наверняка тоже, а вот к квадратным прогулам ещё не очень дисперсия.
99: Как характеризует всегда единицу измерения квадрат от первоначальной единицы измерения, так как при вычислении дисперсии как раз возводится все в квадраты, но как?
100: Показали исследования, теоретические исследования дисперсии данное число у нас, то есть данная характеристика, она состоятельна, но, к сожалению, она является смещённой, то есть она
101: Не точно характеризует наш наше распределение, поэтому была введена дополнительная вариация выборочной дисперсии, а именно исправленная выборочная диспер.
102: Исправленная выборочная дисперсия рассчитывается на основе выборочной дисперсии, то есть для исправленной выборочной дисперсии или статистической выборочной дисперсии необходимо выборочную дисперсию умножить.
103: На дробь, которая при увеличении общего количества элементов все время будет стремиться к единице. То есть в нашем случае это 25 / 24, то есть дробь достаточно 0 целых 9.
104: И так далее. Если количество элементов у нас будет ещё больше, например, 100 / 99 или 1000, делить на 999, то эта дробь все больше и больше стремится к единичке. И исправленная выборочная
105: Дисперсия будет все больше, больше стремиться к выборочной дисперсии. То есть это исправленная выборочная дисперсия является хорошим показателем только при небольших количествах, при
106: Большом объёме выборки. Итак, исправленная выборочная дисперсия с в квадрате считается, таким образом, и является получаемое значение 3 целых 91 со
107: И 6 в периоде, то есть 6 в скобочках говорит о том, что у нас в записи будет 3 целых 9, 1 и 6, 6, 6, 6, 6, много шестёрок. Дальше.
108: Так, ну как я и говорила, выборочная дисперсия, что исправленная, что неисправленная нам показывает прогулы в квадрате квадрат единицы измерения, это не всегда удобно для рассмотрения.
109: Поэтому, чтобы вернуться обратно к обычным прогулам, необходимо из нашего наименования, из проголо в квадрате извлечь корень, получим получаемые перемен.
110: Получаемая величина именуется среднее квадратическое отклонение если мы извлекаем корень из выборочной дисперсии, мы получаем выборочное среднее квадратическое отклонение, если мы извлекаем корень.
111: Из исправленной выборочной дисперсии, то мы получаем исправленное выборочное среднеквадратическое отклонение, в данном случае исправленное в кавычках, потому что мы не само выборочное ско исправляем, а создаём выборочное.
112: Score на основе уже исправленной дисперсии, практиче, в подавляющем количестве случаев корень из дисперсии у нас является числом неточным, неконкретным. Соответственно, результат необходимо округ
113: Итак, вот какое большое количество числовых характеристик мы получили из 1 ряда в 25 чисел 25 студентов с двадцатью пятью разными прогулами.
114: Синим выделено то, что было очевидно, найдено сразу, а черненьким то, что пришлось высчитывать, так-то, что мы рассмотрели, это так называемая дискретная величина, то есть
115: Величина, у которой есть конкретные значения и не может быть, например, Дробных или каких-то промежуточных наименований. То есть очень трудно студенту опоздать 0,5 раз. Это значит, что он на полпары прошёл или как вряд.
116: В журнале энка ставится за 1 клеточку и не может быть пол энки или четверть энки. То есть вот это дискретная конкретная величина, но часто бывает, что
117: Таблицы необходимо оформлять с использованием некоторых промежутков интервалов, в этом случае говорят об интервальной форме записи случай статистического распределения.
118: И вот рассмотрим такое замечательное распределение. То есть даны некоторые значения в промежутках. Тогда частотой каждого промежутка мы назовём то количество значений, которое вот
119: Промежуток попала. То есть это не значит, что у нас 1,7 7 раз повторилась. Это значит, что у нас есть 7 чисел, которые входят в 1 промежуток. Они могут быть все разными. Что-то из них может повто.
120: Что-то из них может отличаться на 1 десятитысячную, главное, что их 7 также при записи интервальной формы статического распределения важно для себя определить, в какую 100.
121: Мы с вами распределим, например, 3,7 это граница, то есть само число 3,7 должно относиться к левому промежутку или к правому промежутку, каждый в конкретном
122: Определяет это самостоятельно, но правило должно распространяться на всю таблицу.
123: Вот, то есть в данном случае нам не даны изначальные значения, нам дано уже сразу же интервальная форма. Общее количество чисел нам представлено, это их 30, мы сложили все частоты.
124: Получили число 30 для интервальной формы очень важен так называемый шаг, то есть длина промежутка для удобства чаще всего используют одинаковый шаг для всех.
125: Промежутков, то есть в нашем случае это 2, то есть длина каждого промежутка. В некоторых случаях удобно давать разные шаги для разных промежутков, но это связано опять же с конкретными условиями.
126: И конкретными значениями некоторой величины рассмотрим такое понятие, как частность или относительная частота для дискретных, случайных, дискретных величин, также они могут быть вычислены, определены.
127: Но в данном случае мы их используем для построения гистограммы, то есть вместо полигона у данной у интервального распределения.
128: Строится гистограмма это у нас фигура, состоящая из прямоугольников в идеале, если прямоугольники полностью друг с другом соседствуют без промежутков н.
129: У меня на изображении прямоугольники имеют небольшие зазорчики, чтобы показать, где начинается 1 и заканчивается другой площадь каждого прямоугольничка из гистограммы должна соответствовать.
130: Как раз частоте мы знаем, что ширина каждого прямоугольничка это 2. То есть это наш шаг. То есть самый левый край, это 1,7. Потом 1 прямоугольник заканчивается на 3,7, потом идёт
131: 5,7 7,7 9,7. И последний прямоугольничек заканчивается на 11,7. То есть ширина прямоугольника есть. Площадь должна равняться частоте соответственно,
132: Высота это частота, делённая на основание. То есть мы используем наименование, частность или относительную частоту, то есть показываем, какую часть от общего количества вкладыва.
133: Каждый из промежуточков и дополнительно делим его на наш шаг на нижней строчке показано наименование как в обыкновенных дробях, так и в десятичных.
134: То есть вот получили высоту прямоугольника для интервальной формы, кумулятор строится точно так же, как и для дискретной формы записи. Единственное, что-то есть.
135: Тоже нам нужно накопительные частоты вычислять, но в качестве центра в качестве точки мы берём середину каждого промежутка. То есть здесь нет прямоугольничков. Здесь есть центр Середина.
136: Промежутков гистограмму в целом тоже можно было бы построить, используя только середину, но тогда
137: Основание каждого прямоугольника было бы бесконечно маленьким, а сам прямоугольник бесконечно большим.
138: Так, для интервальной формы, кроме гистограммы и кумуляты, также можно вычислить все остальные числовые характеристики, которые мы с вами использовали. Итак, начнём с моды.
139: Чтобы вычислить моду для интервальной формы, мы воспользуемся такой интересной, немножко страшноватенькой формулой. Для начала мы определим промежуток с наибольшей частотой. В нашем случае это 2 промежуток.
140: И начинается он с числа 3,7 это наше x нулевое частота промежутка до этого это 7, то есть наш 1 промежуток и частота промежутка после это 3 про.
141: Промежуток его частота составляет 6, высота шаг у нас по прежнему 2, общее количество 30. Подставляя все наименования в формулу, мы получаем некоторое число четы.
142: 3 целых 5, 8, 8, 9. То есть это число находится как раз во 2 промежутке, и оно предположительно составляет самое наиболее часто повторяемое из
143: Всего наименования, так как сами числа нам неизвестны, нам дано сразу же распределение мы не можем ни подтвердить, ни утверждать обратно для медианы формула.
144: Также достаточно крупная. Итак, медиана нам описывает центр всего набора значений. То есть у нас всего 30 их значит, это чётное количество, центральные элементы пятна.
145: И 16 если бы это было обычное дискретное распределение, мы бы взяли пятнадцатые, шестнадцатые значения, их сложили, поделили на 2, и было бы медиана, но у нас опять же интервальная форма.
146: Поэтому мы определяем наш промежуточек с номерами 15 и 16. У этого эти, этот промежуток с этими номерами опять же, попался на
147: На 2. То есть, если посчитать, то во 2 промежуток входят все элементы с 8 по 18, 15, 16. Там как раз есть. 2 промежуток начинается с числа 3 целых.
148: 7/10 и накопительная частота промежутка до этого составляет 7. То есть здесь используется накопительная частота. Подставим эти значения в нашу формулу и
149: Получим число 5,1 и 54 в периоде.
150: Также все остальные числовые характеристики можно определить для нашей интервальной формы, используя уже в качестве основы середину промежутка, то есть
151: Мода и медиана определяются по интервальной форме, а вот выборочная средняя дисперсия, исправленная дисперсия, а также средние квадратические отклонения исполь вычисляются на основе
152: Середины промежутка и частот данного промежутка.
153: Итак, господа.