Учебный курс

Сбор и анализ данных в Python — неделя 1: основы теории вероятностей

Конспект первой недели курса «Сбор и анализ данных в Python» из специализации «Машинное обучение: от статистики до нейросетей». Пять статей: дорожная карта курса, природа случайности и подходы к вероятности, случайные величины и их распределения, характеристики распределений, обзор семи основных распределений. К каждой статье приложен набор карточек для самопроверки. Материал составлен по субтитрам видеоуроков и расширен пояснениями и примерами; расширения отмечены в тексте.

#математика#теория вероятностей#статистика#python#машинное обучение#конспект
Лайков: 3

Сохранений: 9

Автор: @yuriyСкопировать курс и учиться

Введение и картина мира

1.1. Дорожная карта курса

Автор: yuriy · Карточек: 6

Дорожная карта курса

Курс — вводный кирпич специализации. Его задача не пересказать теорию вероятностей ещё раз, а собрать минимальный набор понятий, на который опирается всё остальное: проверка гипотез, доверительные интервалы, регрессия, метрики качества моделей.

Два пласта

Теоретический пласт — основные понятия теории вероятностей:

  • случайная величина: что именно мы измеряем

  • закон распределения и плотность: с какими вероятностями появляются значения

  • функция распределения: какова вероятность оказаться левее точки

  • математическое ожидание: какое значение типично

  • дисперсия: насколько сильно значения разбросаны

Практический пласт — работа с реальными данными:

  • симуляция случайных величин на Python

  • описательные статистики

  • собственный парсер для сбора данных

  • разведочный анализ данных и визуализация

Пласты идут вперемешку, а не строго друг за другом. Определение, которое сразу применили к данным, запоминается лучше изолированного.

Две теоремы, на которых держится статистика

Центральная предельная теорема (ЦПТ). Среднее большого числа независимых слагаемых распределено приблизительно нормально — почти независимо от того, как распределены сами слагаемые. Именно поэтому нормальное распределение встречается повсеместно. Отдельная важная тема — границы применимости: при тяжёлых хвостах или зависимых наблюдениях теорема не работает.

Закон больших чисел (ЗБЧ). Выборочное среднее сходится к истинному математическому ожиданию с ростом объёма выборки.

Эти теоремы легко перепутать, поэтому запомните различие: ЦПТ говорит о форме распределения среднего, ЗБЧ — о том, к какому значению это среднее сходится.

Закон больших чисел и страховой бизнес

Отдельный страховой случай непредсказуем: конкретный дом либо сгорит, либо нет. Но если застраховать много независимых домов, доля сгоревших окажется близка к истинной вероятности пожара. Значит, суммарные выплаты предсказуемы, и страховщик может назначить премию чуть выше ожидаемых выплат.

Ключевое условие — именно независимость. Когда риски скоррелированы (наводнение топит сразу весь район, ипотечные дефолты случаются одновременно), закон больших чисел не спасает.

Описательные статистики сквозь призму случайности

Главная идея блока: статистика, посчитанная по выборке, сама является случайной величиной. Опросили двух дополнительных респондентов — все числа изменились.

Насколько сильно они изменятся, зависит от свойств исходной величины: где-то сдвиг будет незаметным, где-то драматическим. Отсюда вывод: чтобы делать корректные выводы, недостаточно посчитать среднее. Нужны статистические алгоритмы, учитывающие эту случайность, и их построением займутся следующие курсы специализации.

Симуляции и метод Монте-Карло

Симуляция — рабочий инструмент, а не декоративный навык. Когда аналитическая формула не выводится или выводится тяжело, ставят численный эксперимент: прогоняют процесс много тысяч раз и смотрят на распределение исходов. Это и называется методом Монте-Карло.

Типичные вопросы, на которые он отвечает: сколько в среднем придётся ждать при такой организации очереди; какова вероятность упереться в лимит при таком трафике; насколько случайной могла быть разница между вариантами A и B в эксперименте.

Сбор данных и разведочный анализ

Данные надо откуда-то брать. В курсе пишется собственный парсер, собирающий информацию из интернета. Затем данные анализируются: разведочный анализ данных (EDA) и визуализация.

Задача этого этапа — увидеть закономерности и сформулировать гипотезы о реальности. Проверять их статистическими методами будут уже в следующих курсах. Порядок такой: парсер собирает данные, EDA показывает закономерности, из них рождаются гипотезы, и только потом идёт статистическая проверка.

Итог

Цель недели: знать основные определения не на уровне «слышал», видеть, что они переплетены друг с другом, и понимать, что теория напрямую сопряжена с данными.

Источники

Субтитры видеоурока 1.1 «Дорожная карта курса» курса «Сбор и анализ данных в Python», специализация «Машинное обучение: от статистики до нейросетей».

  1. Центральная предельная теорема (ЦПТ)

    Среднее большого числа независимых слагаемых распределено приблизительно нормально, почти независимо от распределения самих слагаемых

  2. Закон больших чисел (ЗБЧ)

    Выборочное среднее сходится к истинному математическому ожиданию с ростом объёма выборки

  3. При каком условии закон больших чисел позволяет страховой компании работать прибыльно?

    Страховые случаи должны быть независимыми: при скоррелированных рисках суммарные выплаты перестают быть предсказуемыми

    Подсказка: Что происходит, когда наводнение топит сразу весь район?

  4. Почему описательную статистику, посчитанную по выборке, рассматривают как случайную величину?

    Её значение зависит от того, какие наблюдения попали в выборку: при другой выборке оно изменится

  5. Метод Монте-Карло

    Численный метод, в котором процесс многократно симулируют и делают выводы по распределению полученных исходов

  6. Разведочный анализ данных (EDA)

    Этап работы, на котором в данных ищут закономерности и формулируют гипотезы, ещё не проверяя их статистическими методами

Показано 6 из 6 карточек

1.2. Случайность и устройство мира

Автор: yuriy · Карточек: 12

Что такое случайность и как устроен мир

Обозначения, действующие весь курс

  • X, Y, Z — заглавные буквы с конца алфавита обозначают случайные величины

  • x, y, z — строчные обозначают конкретные значения, которые эти величины приняли

  • A, B, C — заглавные с начала алфавита обозначают события

  • P — вероятность, E(X) — математическое ожидание, Var(X) — дисперсия

  • cov(X, Y) — ковариация, rho(X, Y) — корреляция

Различие между X и x — не педантизм. Заглавная X — это весь механизм случайности с его вероятностями. Строчная x — один уже выпавший результат, обычное число. Путаница между ними порождает значительную часть ошибок в статистике.

Есть ли в мире случайность

Два привычных примера «случайного»: игральная кость выпадает одной из граней с вероятностью одна шестая; автобус приходит через случайный промежуток времени.

Но присмотримся. Если бы мы точно знали момент вращения при броске, потоки воздуха в комнате, упругость стола и положение центра масс кубика, мы бы однозначно предсказали выпавшую грань. С автобусом то же самое: зная трафик по городу, светофорные циклы и траекторию машины, можно точно посчитать время прибытия.

Мы называем эти явления случайными не потому, что они случайны, а потому что не в состоянии измерить все влияющие факторы. На такое измерение нужно немыслимое количество ресурсов.

Демон Лапласа и детерминизм

Первым это отчётливо сформулировал Пьер-Симон Лаплас в XVIII веке. Он вообразил существо, способное провести все измерения и точно предсказать будущее, — демона Лапласа.

Детерминизм в его концепции звучит так: все явления вокруг нас не случайны, и при полном знании положения и скорости каждого атома будущее предсказывалось бы точно.

Но между совершенством детерминированной природы и несовершенством человеческого познания лежит пропасть. Преодолеть её мы не можем, поэтому вынуждены упрощать происходящее — и результат этого упрощения называем случайностью.

Отсюда главная формулировка: вероятность — это язык для описания собственного незнания. Не свойство кубика, а свойство наших отношений с кубиком. Ту же мысль, только более размыто, чуть раньше высказал Томас Байес.

Расширение: два вида неопределённости

Этих терминов в лекции нет, но различение постоянно встречается в машинном обучении и помогает понять сказанное выше.

Эпистемическая неопределённость — от нехватки знаний и измерений: мы просто не знаем всех потоков воздуха и особенностей трафика. Она уменьшается с получением новых данных и признаков.

Алеаторная неопределённость — неустранимый внутренний шум самого процесса, как в квантовой механике. Она не уменьшается, сколько данных ни собирай.

Детерминизм Лапласа утверждает, что вся неопределённость эпистемическая. Квантовая механика XX века с этим не согласилась. Для практики различие полезно так: если ошибка модели эпистемическая, помогут новые признаки и данные; если алеаторная — не помогут, и надо принять предел точности.

Байесовцы против частотников

Из вопроса «что такое вероятность» выросли два подхода к статистике.

Частотный подход определяет вероятность как предельную частоту события при многократном повторении опыта в одинаковых условиях. Вероятность обязана быть объективной. Отсюда следствие: вопрос «какова вероятность, что кандидат N станет президентом» для частотника бессмыслен. Конкретные выборы происходят один раз и не воспроизводятся; чтобы посчитать частоту, понадобилась бы куча параллельных вселенных с теми же условиями.

Ключевая фигура этого лагеря — Рональд Фишер. Он вместе с современниками ответственен практически за весь статистический аппарат, которым мы пользуемся сегодня: процедуру проверки гипотез и метод максимального правдоподобия.

Байесовский подход определяет вероятность как степень уверенности, которая может быть субъективной и обновляется при поступлении данных. Вопрос про выборы для него осмыслен: это моя личная степень уверенности.

Ядро второго подхода — формула Байеса: апостериорная вероятность гипотезы пропорциональна произведению правдоподобия данных на априорную вероятность этой гипотезы. Именно наличие априорного убеждения и делает вероятность субъективной: двое с разным опытом стартуют с разных априорных и получат разные ответы на одних и тех же данных.

Позже в курсе разбирается, как эти подходы дополняют друг друга, а не воюют.

Главная метафора курса: сундук

Где-то существует процесс порождения данных — механика реальности, производящая наблюдения. Назовём его сундуком. Его внутреннего устройства мы не знаем и не увидим никогда. Мы видим только то, что он выплёвывает наружу: выборки.

Рабочий цикл получается такой:

  • сундук выдал нам выборку

  • мы предполагаем модель — как он устроен изнутри

  • мы проверяем предположение по тем самым реальным данным

  • если не сходится, модель меняем

Здесь принципиально вот что: модель — это описание нашего невежества, а не описание истины. Мы не вскрываем сундук. Поэтому вопрос «истинна ли модель» некорректен; корректный вопрос — «релевантна ли она имеющимся данным».

Уровни сложности моделей

  • простейший: одна случайная величина с некоторым распределением

  • средний: регрессия, где одни величины влияют на другие

  • сложный: матричные разложения и нейронные сети со сложными взаимосвязями

В этом курсе работаем с простейшим уровнем. Даже на нём уже можно делать содержательные выводы.

Источники

Субтитры видеоурока 1.2 «Что такое случайность и как устроен мир». Раздел про эпистемическую и алеаторную неопределённость — добавленное расширение, в лекции эти термины не назывались.

  1. Чем в обозначениях курса различаются заглавная X и строчная x?

    Заглавная X — сама случайная величина, то есть механизм со всеми её вероятностями; строчная x — конкретное значение, которое она уже приняла

  2. Демон Лапласа

    Воображаемое существо, способное измерить состояние каждого атома и потому точно предсказать будущее

  3. Детерминизм в концепции Лапласа

    Представление о том, что явления не случайны и при полном знании начальных условий предсказуемы точно

  4. Что в этом курсе понимается под вероятностью?

    Способ измерить неопределённость, порождённую неполнотой нашего знания, а не свойство самого объекта

  5. Как частотный подход определяет вероятность?

    Как предельную частоту события при многократном повторении опыта в одинаковых условиях

  6. Почему частотный подход отказывается приписывать вероятность победе конкретного кандидата на выборах?

    Событие происходит один раз и не воспроизводится в тех же условиях, поэтому частота для него не определена

    Подсказка: Чего не хватает, кроме данных опросов?

  7. Как байесовский подход трактует вероятность?

    Как степень уверенности, которая может быть субъективной и обновляется при поступлении данных

  8. Рональд Фишер

    Ключевая фигура частотной статистики, автор процедуры проверки гипотез и метода максимального правдоподобия

  9. «Сундук» как метафора курса

    Недоступный наблюдению процесс порождения данных: видны только выборки на его выходе, а устройство приходится предполагать

  10. Что описывает статистическая модель в концепции «сундука»?

    Наше незнание реальности: это предположение об устройстве процесса, а не сама истина

    Подсказка: Корректен ли вопрос «истинна ли модель»?

  11. Эпистемическая неопределённость

    Неопределённость от нехватки знаний и измерений; уменьшается при получении новых данных и признаков

  12. Алеаторная неопределённость

    Неустранимый внутренний шум самого процесса; не уменьшается, сколько данных ни собирай

Показано 12 из 12 карточек

Случайные величины и их характеристики

1.3. Случайная величина и её распределение

Автор: yuriy · Карточек: 16

Случайная величина и её распределение

Простейшая модель «сундука» из прошлой статьи — одна случайная величина. Разберём, как её задают.

Формальное определение

Случайная величина — это функция, которая каждому элементарному исходу опыта сопоставляет число.

Пример: бросаем две монеты, исходы — ОО, ОР, РО, РР. Величина X = «число орлов» сопоставляет им числа 2, 1, 1, 0. Отсюда понятно, почему X — не число, а механизм. Число получается, когда механизм сработал, и это уже x.

Два типа случайных величин

Дискретная принимает конечное или счётное множество значений. Примеры: число звонков, очки в баскетболе, очки на игральной кости, число орфографических ошибок в тексте.

Непрерывная принимает континуум значений, непрерывно размазанных по промежутку. Примеры: рост человека, время ожидания автобуса, вес человека. Рост непрерывен потому, что его можно измерять со сколь угодно высокой точностью: 178 см, 178,3 см, 178,34 см.

Оговорка для практики: в реальных данных рост записан как «178», то есть формально дискретен. Непрерывность здесь — удобная идеализация, считать интеграл проще, чем сумму по всем возможным миллиметрам.

Дискретная величина: закон распределения

Чтобы полностью описать дискретную величину, выписывают таблицу: каждому значению сопоставлена вероятность, с которой она это значение принимает.

Сквозной пример курса — лотерея. Величина принимает значение минус 12 рублей с вероятностью 0,5; ноль рублей с вероятностью 0,25; плюс 10 рублей с вероятностью 0,25.

Два обязательных условия для любого закона распределения:

  • каждая вероятность лежит в отрезке от 0 до 1

  • сумма всех вероятностей равна 1

Проверка для лотереи: 0,5 плюс 0,25 плюс 0,25 равно 1.

На графике по горизонтальной оси откладывают значения величины, по вертикальной — их вероятности. Сумма высот всех палочек равна единице. Такой график называют полигоном распределения.

Функция распределения

Второй способ описать ту же величину — функция распределения, она же кумулятивная:

F(x) = P(X <= x)

Словами: какова вероятность, что величина примет значение меньше либо равное заданному x.

Для дискретного случая это сумма всех вероятностей левее точки. В формуле такой суммы часто используют индикаторную функцию — она равна 1, когда записанное в ней условие выполняется, и 0, когда не выполняется. Технический приём: вместо «просуммируй только подходящие слагаемые» пишут сумму по всем, а неподходящие сами обнуляются.

Для лотереи функция ведёт себя так:

  • левее минус 12 она равна 0

  • на промежутке от минус 12 до 0 равна 0,5

  • на промежутке от 0 до 10 равна 0,75

  • правее 10 равна 1

Главное, что надо уметь читать с такого графика: высота каждого скачка равна вероятности этой точки. Значит, по ступенькам всегда можно восстановить исходную таблицу.

Непрерывная величина: плотность

Для непрерывной величины таблицу составить невозможно: значений бесконечно много, и между любыми двумя лежит ещё бесконечно много. Поэтому её описывают плотностью распределения f(x).

Ключевая идея: вероятность равна площади под кривой плотности. Вероятность попасть на отрезок от a до b — это интеграл плотности от a до b. А вся площадь под плотностью равна единице, потому что в какое-то значение величина попадёт обязательно.

Здесь прячется частая ошибка. Значение плотности само по себе вероятностью не является. Отсюда следствие, которое многих сбивает: плотность может быть больше единицы. Например, равномерное распределение на отрезке от 0 до 0,1 имеет плотность 10. Противоречия нет: площадь всё равно равна 0,1 умножить на 10, то есть 1.

Проверяйте себя вопросом: я смотрю на высоту или на площадь? Вероятность — всегда площадь.

Функция распределения непрерывной величины определяется так же, только сумма заменяется интегралом. Ведём засечку слева направо и копим площадь — получается S-образная кривая, плавно растущая от 0 до 1.

Связь плотности и функции распределения

Это две формы записи одной и той же информации:

  • F — интеграл от f

  • f — производная от F

Проще всего запомнить так: плотность — это скорость накопления вероятности. Там, где F растёт круто, f большая. Там, где F почти горизонтальна, f близка к нулю.

Сводка свойств

  • плотность есть только у непрерывных величин, у дискретных вместо неё таблица

  • плотность неотрицательна при любом x

  • полный интеграл плотности равен 1

  • F не убывает и принимает значения от 0 до 1

  • вероятность попасть на отрезок можно считать двумя способами: как интеграл плотности от a до b или как разность F(b) - F(a)

Почему вероятность точки равна нулю

Для непрерывной величины вероятность принять конкретное значение a всегда равна нулю: это интеграл от a до a, а у точки нет площади, фигура вырождается в отрезок нулевой ширины.

Это одна из самых контринтуитивных вещей в теории вероятностей, и её важно понять правильно. Нулевая вероятность не означает невозможности. Рост случайного человека окажется каким-то конкретным числом, скажем ровно 178,4213 см. Вероятность именно этого значения была нулевой, но событие всё равно произошло.

Практический вывод: для непрерывных величин осмысленно спрашивать только про интервалы. Не «какова вероятность роста ровно 180», а «какова вероятность роста от 179,5 до 180,5». Полезное следствие: строгие и нестрогие неравенства для непрерывных величин равносильны, поскольку границы вносят нулевой вклад.

Мостик между дискретным и непрерывным

Везде, где в дискретном случае стоит сумма, в непрерывном стоит интеграл. Везде, где стоит вероятность, стоит плотность. Это правило работает почти для всех формул курса, включая матожидание и дисперсию из следующей статьи.

Это же на Python

import numpy as np
from scipy import stats

# Непрерывная величина: стандартное нормальное распределение
X = stats.norm(loc=0, scale=1)   # loc - матожидание, scale - СКО

X.pdf(0)      # 0.3989 - ПЛОТНОСТЬ в точке, не вероятность
X.cdf(1.96)   # 0.975  - P(X <= 1.96)
X.ppf(0.975)  # 1.96   - обратная функция, квантиль
X.rvs(size=1000)

# Вероятность попасть на отрезок - двумя способами
print(X.cdf(1) - X.cdf(-1))   # 0.6827

# Вероятность конкретной точки у непрерывной величины
print(X.cdf(0) - X.cdf(0))    # 0.0

Интерфейс scipy.stats одинаков для всех распределений: pmf — вероятность значения у дискретных, pdf — плотность у непрерывных, cdf — функция распределения, ppf — квантиль, rvs — генерация выборки.

Источники

Субтитры видеоурока 1.3 «Случайная величина и её распределение». Формальное определение через функцию на пространстве исходов и примеры кода — добавленные расширения.

  1. Дискретная случайная величина

    Случайная величина, принимающая конечное или счётное множество значений

  2. Непрерывная случайная величина

    Случайная величина, значения которой непрерывно размазаны по промежутку, то есть образуют континуум

  3. Закон распределения дискретной случайной величины

    Таблица, в которой каждому значению величины сопоставлена вероятность, с которой она это значение принимает

  4. Каким двум условиям обязан удовлетворять закон распределения дискретной величины?

    Каждая вероятность лежит в отрезке от 0 до 1, и сумма всех вероятностей равна 1

  5. Функция распределения F(x)

    Вероятность того, что случайная величина примет значение меньше либо равное x: F(x) = P(X ≤ x)

  6. Плотность распределения f(x)

    Функция, площадь под которой на промежутке равна вероятности попадания величины в этот промежуток

  7. Может ли плотность распределения принимать значения больше единицы?

    Да: плотность не является вероятностью, вероятность равна площади под ней

    Подсказка: Какая плотность у равномерного распределения на отрезке от 0 до 0,1?

  8. Чему равна полная площадь под плотностью распределения?

    Единице: интеграл плотности по всей области значений величины равен 1

  9. Чему равна вероятность того, что непрерывная величина примет конкретное значение a?

    Нулю: интеграл от a до a равен нулю, поскольку у точки нет площади

  10. Значит ли нулевая вероятность значения, что оно невозможно?

    Нет: у непрерывной величины вероятность каждого конкретного значения равна нулю, но какое-то значение всё равно реализуется

  11. Как связаны плотность f(x) и функция распределения F(x)?

    F — интеграл от f, а f — производная от F

  12. Какими двумя свойствами обладает любая функция распределения F(x)?

    Она не убывает и принимает значения от 0 до 1

  13. Двумя способами: чему равна вероятность попадания непрерывной величины на отрезок от a до b?

    Интегралу плотности от a до b, он же разность F(b) − F(a)

  14. Что означает высота скачка ступенчатой функции распределения?

    Вероятность того значения, в котором происходит скачок

    Подсказка: Что можно восстановить по графику ступенек?

  15. Индикаторная функция

    Функция, равная 1, когда записанное в ней условие выполняется, и 0, когда не выполняется

  16. Почему непрерывную величину нельзя задать таблицей значений и вероятностей?

    Значений бесконечно много, и между любыми двумя лежит ещё бесконечно много, поэтому таблицу составить невозможно

Показано 16 из 16 карточек

1.4. Характеристики случайных величин

Автор: yuriy · Карточек: 22

Характеристики случайных величин

Математическое ожидание

Матожидание — это среднее значение, которое принимает случайная величина. Не одно из значений, а центр тяжести всего распределения.

Для дискретной величины: каждое значение умножаем на его вероятность и складываем. Для непрерывной логика та же, но вместо суммы интеграл, а вместо вероятности плотность.

Пример: лотерея

Берём лотерею из прошлой статьи: минус 12 рублей с вероятностью 0,5; ноль с вероятностью 0,25; плюс 10 с вероятностью 0,25.

E(X) = -12 * 0,5 + 0 * 0,25 + 10 * 0,25 = -6 + 0 + 2,5 = -3,5 рубля

Интерпретация: в отдельном розыгрыше можно и выиграть, и проиграть, но в среднем каждая игра забирает 3,5 рубля. Участвовать в такой лотерее невыгодно.

Обратите внимание: матожидание равно значению, которого в таблице вообще нет. Выпадает либо минус 12, либо 0, либо плюс 10. Матожидание описывает не типичный исход, а долгосрочный итог. Это центр тяжести: если поставить палочки распределения на невесомую рейку, она уравновесится в точке минус 3,5.

Пример: равномерное распределение

Равномерное распределение выдаёт любое значение с отрезка от a до b равновероятно. Его плотность — плашка высотой 1/(b-a), повисшая над отрезком. Высота выбрана так, чтобы площадь прямоугольника равнялась единице.

Взяв интеграл, получаем E(X) = (a + b) / 2середину отрезка. Логично: раз вероятностная масса не перетягивает ни в одну сторону, в среднем попадаем в центр.

Свойства математического ожидания

  • матожидание константы равно самой константе: 42 — это всегда 42

  • E(X + Y) = E(X) + E(Y)всегда, независимость не требуется

  • константу можно вынести: E(aX) = a * E(X)

  • E(XY) = E(X) * E(Y)только если величины независимы

Это главная ловушка темы. Для суммы равенство верно всегда. Для произведения — только при независимости; иначе в формуле появляется ковариация, описывающая связь величин.

Важно и то, что матожидание — не случайная величина. Это конкретное число, детерминированная характеристика распределения.

Почему нужна дисперсия

Естественная первая идея измерить разброс — посчитать, насколько в среднем величина отклоняется от своего среднего, то есть E(X - E(X)). Раскроем это выражение: оно равно E(X) - E(E(X)). Но E(X) — константа, а матожидание константы равно ей самой. Значит второе слагаемое «сгорает», и остаётся E(X) - E(X), то есть ноль.

Это ноль для любой величины: плюсовые и минусовые отклонения взаимно сокращаются. Как мера разброса такая величина бесполезна — и именно поэтому вводят дисперсию с квадратом.

Дисперсия

Дисперсия — мера разброса, матожидание квадрата отклонения величины от её матожидания. Квадрат нужен, чтобы отклонения не сокращались.

Считать по определению неудобно, поэтому выводят рабочую формулу. Вывод стоит уметь воспроизвести, его часто спрашивают:

  • раскрываем квадрат: E[X^2 - 2X*E(X) + (E(X))^2]

  • пользуемся линейностью и выносим константы: E(X^2) - 2*(E(X))^2 + (E(X))^2

  • приводим подобные

Получается: Var(X) = E(X^2) - (E(X))^2

Словами: матожидание квадрата минус квадрат матожидания.

Дисперсия лотереи

Сначала считаем матожидание квадрата — те же вероятности, но значения возведены в квадрат:

E(X^2) = 144 * 0,5 + 0 * 0,25 + 100 * 0,25 = 72 + 25 = 97

Затем подставляем в формулу:

Var(X) = 97 - (-3,5)^2 = 97 - 12,25 = 84,75

Обратите внимание на единицы. Матожидание получилось в рублях, а дисперсия — в рублях в квадрате, потому что мы возводили в квадрат. «Рубль в квадрате» интерпретировать невозможно, и это главная неудобность дисперсии.

Для равномерного распределения аналогичный вывод даёт Var(X) = (b - a)^2 / 12. Чем шире отрезок, тем непредсказуемее величина, причём зависимость квадратичная.

Среднее квадратическое отклонение

Чтобы избавиться от квадратных единиц, из дисперсии берут корень. Получается СКО, обозначаемое сигмой.

Для лотереи сигма равна корню из 84,75, то есть примерно 9,21 рубля — уже нормальные рубли, которые можно сравнить с матожиданием. Читается это так: средний результат минус 3,5 рубля при разбросе около 9,21 рубля. Разброс почти втрое больше среднего, то есть отдельная игра совершенно непредсказуема, и «в среднем теряю 3,5 рубля» проявится только на длинной дистанции.

Свойства дисперсии

  • Var(a) = 0 — константа абсолютно предсказуема, отклоняться не от чего

  • Var(X + Y) = Var(X) + Var(Y)только для независимых величин

  • Var(aX) = a^2 * Var(X) — константа выходит с квадратом

  • Var(X + a) = Var(X) — сдвиг перемещает распределение, но не меняет разброс

  • Var(X - Y) = Var(X) + Var(Y) для независимых — сумма, а не разность

Последнее свойство самое контринтуитивное. Вывод короткий: константу минус один выносим из-под дисперсии с возведением в квадрат, она превращается в плюс один.

Смысл: вычитая одну случайную величину из другой, мы не гасим неопределённость, а складываем её. Два источника шума — шума стало больше, а не меньше. Это прямо работает в A/B-тестах: дисперсия разницы между группами равна сумме их дисперсий, поэтому на разницу нужно больше данных, чем на одну группу.

Если запоминать одно правило: у матожидания сумма раскладывается всегда, у дисперсии — только для независимых.

Мода

Мода — самое популярное значение. У дискретной величины это значение с наибольшей вероятностью, у непрерывной — точка локального максимума плотности.

Если пиков несколько, распределение называют мультимодальным. Это классический случай, когда матожидание бесполезно и даже вредно: среднее попадает в провал между пиками и указывает на значение, которое почти не встречается.

Пример: время отклика сервиса, где часть запросов идёт из кэша (около 5 мс), а часть в базу (около 300 мс). Среднее «110 мс» не описывает ни один реальный запрос. Лечится это не другой статистикой, а разделением на подгруппы. Поэтому в разведочном анализе сначала строят гистограмму, а уже потом считают среднее.

Медиана

Медиана — значение, делящее вероятностную массу ровно пополам: вероятности оказаться левее и правее неё равны 0,5.

Главное её преимущество — устойчивость к выбросам. Классическая иллюстрация: в компании из десяти человек девять получают по 60 тысяч, а директор — миллион. Среднее равно 154 тысячам и не описывает никого. Медиана равна 60 тысячам и описывает реальное положение дел.

Правило: для скошенных данных (зарплаты, выручка, время отклика, длительность сессий) смотрите медиану; для симметричных можно среднее.

Квантили

Квантиль уровня гамма — такое значение q, что вероятность попасть левее него равна гамма, то есть F(q) = гамма. Иначе говоря, квантиль — это обратная функция распределения; в scipy она называется ppf.

  • медиана — квантиль уровня 0,5

  • нижний и верхний квартили — уровни 0,25 и 0,75

  • p95 и p99 — стандарт мониторинга: «95 процентов запросов быстрее, чем...»

Как соотносятся мода, медиана и среднее

  • у симметричного распределения все три совпадают

  • при скосе вправо: мода меньше медианы, медиана меньше среднего

  • при скосе влево порядок обратный

Правило запоминания: среднее всегда тянется в сторону длинного хвоста, потому что в него входят все экстремальные значения со своим весом. Медиана двигается слабо, мода не двигается вовсе.

Частые ошибки

  • считать, что Var(X - Y) = Var(X) - Var(Y); дисперсии складываются, а сама дисперсия вообще не может быть отрицательной

  • забывать квадрат в Var(aX) = a^2 * Var(X)

  • применять E(XY) = E(X) * E(Y) к зависимым величинам

  • сравнивать дисперсию с матожиданием напрямую; они в разных единицах, сравнивать надо с сигмой

  • считать среднее у мультимодальных или сильно скошенных данных

  • путать E(X^2) и (E(X))^2; для лотереи это 97 против 12,25, и их разность как раз и есть дисперсия

Это же на Python

import numpy as np
from scipy import stats

values = np.array([-12, 0, 10])
probs = np.array([0.5, 0.25, 0.25])

E_X = (values * probs).sum()        # -3.5
E_X2 = (values**2 * probs).sum()    # 97.0
var_X = E_X2 - E_X**2               # 84.75
std_X = np.sqrt(var_X)              # 9.206

# Проверяем свойства дисперсии симуляцией
rng = np.random.default_rng(0)
X = rng.normal(0, 3, 200_000)    # Var = 9
Y = rng.normal(0, 4, 200_000)    # Var = 16

(X + Y).var()      # около 25 = 9 + 16
(X - Y).var()      # около 25 - тоже сумма
(2 * X).var()      # около 36 = 4 * 9
(X + 100).var()    # около 9 - сдвиг не меняет разброс

Источники

Субтитры видеоурока 1.4 «Характеристики случайных величин». Примеры про зарплаты, время отклика сервиса и A/B-тесты — добавленные иллюстрации.

  1. Математическое ожидание E(X)

    Среднее значение случайной величины: её значения, взвешенные по вероятностям и просуммированные

  2. Как вычисляется матожидание дискретной величины?

    Каждое значение умножается на его вероятность, и все произведения складываются

  3. Дисперсия Var(X)

    Мера разброса: математическое ожидание квадрата отклонения величины от её матожидания

  4. Вычислительная формула дисперсии

    Var(X) = E(X²) − (E(X))², то есть матожидание квадрата минус квадрат матожидания

  5. Почему величина E(X − E(X)) не годится как мера разброса?

    Она тождественно равна нулю для любой величины: положительные и отрицательные отклонения взаимно сокращаются

    Подсказка: Что получится, если раскрыть это выражение по свойству линейности?

  6. Среднее квадратическое отклонение (СКО)

    Корень из дисперсии; возвращает меру разброса в исходные единицы измерения величины

  7. В каких единицах измеряется дисперсия?

    В квадратах единиц исходной величины: если величина в рублях, дисперсия в рублях в квадрате

  8. Чему равна Var(X + Y) для независимых величин?

    Var(X) + Var(Y): дисперсии складываются

  9. Чему равна Var(X − Y) для независимых величин?

    Var(X) + Var(Y): при вычитании дисперсии тоже складываются, а не вычитаются

    Подсказка: Что происходит с константой −1 при выносе из-под знака дисперсии?

  10. Чему равна Var(aX), где a — константа?

    a²·Var(X): константа выносится из-под знака дисперсии в квадрате

  11. Как сдвиг на константу влияет на дисперсию, то есть чему равна Var(X + a)?

    Var(X): сдвиг перемещает распределение, но не меняет его разброс

  12. При каком условии верно равенство E(XY) = E(X)·E(Y)?

    Только если величины X и Y независимы; иначе появляется ковариация

  13. Требуется ли независимость для равенства E(X + Y) = E(X) + E(Y)?

    Нет: матожидание суммы равно сумме матожиданий всегда

  14. Является ли математическое ожидание случайной величиной?

    Нет: это конкретное число, детерминированная характеристика распределения

  15. Мода случайной величины

    Значение с наибольшей вероятностью; у непрерывной величины — точка локального максимума плотности

  16. Медиана случайной величины

    Значение, делящее вероятностную массу пополам: вероятности оказаться левее и правее него равны 0,5

  17. Квантиль уровня гамма

    Значение q, левее которого лежит доля гамма всей вероятности, то есть F(q) = гамма

  18. Квантилем какого уровня является медиана?

    Уровня 0,5

  19. Мультимодальное распределение

    Распределение, плотность которого имеет несколько локальных максимумов

  20. Почему на мультимодальных данных среднее может вводить в заблуждение?

    Оно попадает в провал между пиками и указывает на значение, которое почти не встречается

  21. Почему на скошенных данных медиана информативнее среднего?

    Медиана устойчива к выбросам, а среднее смещается в сторону длинного хвоста

    Подсказка: Что произойдёт со средней зарплатой, если в отдел придёт директор с окладом в миллион?

  22. Как соотносятся мода, медиана и среднее у распределения с длинным правым хвостом?

    Мода меньше медианы, а медиана меньше среднего: хвост тянет среднее вправо

Показано 22 из 22 карточек

Зоопарк распределений

1.5. Какими бывают случайные величины

Автор: yuriy · Карточек: 38


tags:

  • конспект

  • теорвер

  • распределения

  • курс/сбор-и-анализ-данных курс: Сбор и анализ данных в Python урок: "1.5" неделя: 1


1.5 Какими бывают случайные величины

[!abstract] Коротко

  • Распределение — это модель явления, а не его истинное устройство. Выбирают её из данных и здравого смысла.

  • Дискретные: Бернулли (один опыт), биномиальное (сколько успехов из nn), геометрическое (когда первый успех), Пуассон (сколько событий за интервал).

  • Непрерывные: экспоненциальное (сколько ждать), равномерное (все значения равновероятны), нормальное (колокол, «всё остальное»).

  • Распределения связаны между собой: биномиальное — это сумма бернуллиевских, Пуассон — предел биномиального, и так далее.

  • Экспоненциальное обладает отсутствием памяти: сколько уже прождали — неважно.

  • Финальное предупреждение урока: любая из этих моделей — не истина в последней инстанции.


1. Логика урока

В уроке 1.2 появился «сундук» — неизвестный процесс порождения данных. В уроке 1.3 мы научились описывать содержимое сундука одной случайной величиной. Здесь — каталог готовых моделей: какое явление каким распределением разумно описывать.


2. Дискретные распределения

2.1. Бернулли — один опыт с двумя исходами

Явление: пол новорождённого. Подбрасывание монеты. Кликнул пользователь или нет.

X \sim \mathrm{Bern}(p)

\mathbb{P}(X = 1) = p \quad (\text{успех}), \qquad \mathbb{P}(X = 0) = 1 - p \quad (\text{неудача})

Функция распределения:

F(x)=\mathbb{P}(X\le x)= \begin{cases} 0, & x<0,\\ 1-p, & 0\le x<1,\\ 1, & x\ge 1. \end{cases}

Распределение Бернулли для разных вероятностей успеха

Единицу и ноль можно приписать любым интересующим нас событиям — «успех» и «неудача» здесь чисто технические ярлыки, без оценочного смысла. В примере с ребёнком: девочка — 1, мальчик — 0.

ПараметрМатожиданиеДисперсия
pp — вероятность успеха\mathbb{E}(X) = p\mathrm{Var}(X) = p(1-p)

[!tip] Когда Бернулли непредсказуемее всего \mathrm{Var} = p(1-p) максимальна при p = 0{,}5 (равна 0,25) и стремится к нулю на краях. Честная монета — самый непредсказуемый исход. Монета, выпадающая орлом в 99 % случаев, почти детерминирована.


2.2. Биномиальное — сколько успехов из nn попыток

Явление: число попаданий в баскетбольную корзину из nn бросков. Сколько из 1000 посетителей сайта оформили заказ.

X \sim \mathrm{Bin}(n, p)

\mathbb{P}(X = k) = C_n^k \, p^k (1-p)^{n-k}, \qquad k = 0, 1, \dots, n

F(x)=\sum_{k=0}^{\lfloor x\rfloor} C_n^k p^k(1-p)^{n-k}, \qquad 0\le x<n,

причём F(x)=0 при x<0 и F(x)=1 при x\ge n.

где C_n^kбиномиальный коэффициент:

C_n^k = \frac{n!}{k!\,(n-k)!}

Биномиальное распределение для разных вероятностей успеха Чем больше pp, тем правее смещается масса распределения.

[!info] Откуда берётся формула Разберём по кусочкам — так она перестаёт быть заклинанием:

  • p^k — вероятность kk попаданий подряд;

  • (1-p)^{n-k} — вероятность остальных n-k промахов;

  • C_n^kсколькими способами эти kk попаданий могут распределиться среди nn бросков.

Последний множитель нужен потому, что нам неважен порядок: «попал-промазал-попал» и «попал-попал-промазал» — оба дают 2 попадания из 3.

Связь с Бернулли

Один бросок — это испытание Бернулли. Общее число попаданий — сумма таких испытаний:

X_{\mathrm{Bin}} = \underbrace{X_1 + X_2 + \dots + X_n}_{\text{каждое } X_i \sim \mathrm{Bern}(p),\ \text{независимы}}

Отсюда характеристики выводятся мгновенно через свойства из урока 1.4 — матожидания складываются всегда, дисперсии складываются, потому что броски независимы:

МатожиданиеДисперсия
\mathbb{E}(X) = np\mathrm{Var}(X) = np(1-p)

То есть просто характеристики Бернулли, умноженные на nn.


2.3. Геометрическое — номер первого успеха

Явление: на каком по счёту броске впервые попали в корзину. Сколько писем отправили до первого ответа.

X \sim \mathrm{Geom}(p)

\mathbb{P}(X = k) = (1-p)^{k-1} \cdot p

F(x)=1-(1-p)^{\lfloor x\rfloor}, \qquad x\ge 1,

а при x<1 имеем F(x)=0.

Формула читается буквально: k-1 раз промахнулись (отсюда (1-p)^{k-1}), затем один раз попали (отсюда pp).

Геометрическое распределение номера первого успеха

Величина принимает счётное бесконечное множество значений: промахиваться можно сколь угодно долго.

МатожиданиеДисперсия
\mathbb{E}(X) = \dfrac{1}{p}\mathrm{Var}(X) = \dfrac{1-p}{p^2}

\mathbb{E}(X) = 1/p интуитивно понятно: при вероятности попадания 0,2 в среднем нужно 5 бросков.

[!warning] Две параметризации — источник путаницы Геометрическое распределение задают двумя способами, и они дают разные ответы:

Что считаемНоситель\mathbb{E}(X)В Python
Номер первого успехаk = 1, 2, 3, \dots1/pstats.geom
Число неудач до успехаk = 0, 1, 2, \dots(1-p)/pnp.random.geometric минус 1

В лекции используется формула (1-p)^{k-1}p и \mathbb{E} = 1/p — это первый вариант, значения с единицы. Прежде чем брать формулу из справочника, всегда проверяйте, с чего начинается носитель.

На слайде рядом с этой формулой указано k=0,1,2,\dots — это опечатка: выражение (1-p)^{k-1}p соответствует k=1,2,3,\dots.


2.4. Произвольное дискретное — просто таблица

Не всё описывается именованным распределением. Игральная кость — это просто таблица из шести строк по 1/61/6. Функция распределения — ступеньки, каждый раз прыгающие на 1/61/6, как в уроке 1.3.

Если XX принимает значения x_1,x_2,\dots с вероятностями p_1,p_2,\dots, то:

p_i=\mathbb{P}(X=x_i), \qquad p_i\ge 0, \qquad \sum_i p_i=1,

F(x)=\mathbb{P}(X\le x)=\sum_{x_i\le x}p_i,

\mathbb{E}(X)=\sum_i x_i p_i,

\mathrm{Var}(X)=\sum_i(x_i-\mathbb{E}X)^2p_i =\sum_i x_i^2p_i-\bigl(\mathbb{E}X\bigr)^2.

Для честной игральной кости:

xx123456
\mathbb{P}(X=x)1/61/61/61/61/61/61/61/61/61/61/61/6

Отсюда \mathbb{E}(X)=3{,}5, а \mathrm{Var}(X)=35/12.


2.5. Пуассон — счётчики событий

Явление: всё, что имеет вид «сколько событий произошло за интервал»:

  • число людей в очереди;

  • число лайков под фотографией;

  • число автобусов, проехавших мимо остановки за час;

  • число персонажей, погибших за главу книги.

X \sim \mathrm{Pois}(\lambda)

\mathbb{P}(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}, \qquad k = 0, 1, 2, \dots

F(x)=e^{-\lambda}\sum_{k=0}^{\lfloor x\rfloor}\frac{\lambda^k}{k!}, \qquad x\ge 0,

а при x<0 имеем F(x)=0.

Распределение Пуассона для разных значений интенсивности

λ\lambda — интенсивность потока событий: среднее число событий за выбранный интервал. Сколько автобусов в среднем за час, сколько смертей в среднем за главу.

МатожиданиеДисперсия
\mathbb{E}(X) = \lambda\mathrm{Var}(X) = \lambda

[!important] Уникальное свойство Пуассона Матожидание и дисперсия совпадают. Это даёт быструю диагностику: посчитайте по своим данным среднее и дисперсию. Если они сильно разошлись — пуассоновская модель не подходит.

Чаще всего дисперсия оказывается больше среднего — это называется сверхдисперсией (overdispersion) и означает, что интенсивность λ\lambda сама не постоянна: лайки идут всплесками, очередь в обед не такая, как в 11 утра.


3. Непрерывные распределения

3.1. Экспоненциальное — сколько ждать до события

Явление: «время до чего-то»:

  • время до прихода трамвая;

  • время до появления следующего человека в очереди;

  • время до поломки механизма.

X \sim \mathrm{Exp}(\lambda)

f(x) = \lambda e^{-\lambda x}, \quad x \ge 0 \qquad\qquad F(x) = 1 - e^{-\lambda x}

Полностью, с учётом области значений:

f(x)= \begin{cases} \lambda e^{-\lambda x}, & x\ge 0,\\ 0, & x<0, \end{cases} \qquad F(x)= \begin{cases} 1-e^{-\lambda x}, & x\ge 0,\\ 0, & x<0. \end{cases}

Вероятность ждать дольше xx — функция выживания:

\mathbb{P}(X>x)=1-F(x)=e^{-\lambda x}.

Плотность экспоненциального распределения

Проверка связи из урока 1.3: производная от F(x) = 1 - e^{-\lambda x} равна \lambda e^{-\lambda x} — это ровно плотность. ✓

МатожиданиеДисперсия
\mathbb{E}(X) = \dfrac{1}{\lambda}\mathrm{Var}(X) = \dfrac{1}{\lambda^2}

Чем меньше λ\lambda, тем дольше в среднем ждём. Время непрерывно — в отличие от числа событий, поэтому здесь плотность, а не таблица.

Свойство отсутствия памяти

\mathbb{P}(X > s + t \mid X > s) = \mathbb{P}(X > t)

Словами: если автобусы приходят по экспоненциальному закону и вы уже прождали 20 минут, это ничего не говорит о том, сколько ждать дальше. Распределение оставшегося времени такое же, как в момент прихода на остановку.

[!warning] Расширение: где это свойство ломается Отсутствие памяти — сильное допущение, и на практике оно часто неверно:

  • Автобусы по расписанию. Прождали 20 минут при интервале 15 — автобус вот-вот придёт. Память есть.

  • Износ оборудования. Деталь, отработавшая 10 лет, сломается скорее новой. Память есть. Для таких случаев берут распределение Вейбулла.

  • Радиоактивный распад, звонки в колл-центр, отказы электроники. Здесь памяти действительно нет — экспоненциальное подходит.

Экспоненциальное — базовый кирпич: на нём строятся более сложные модели времени жизни (survival analysis).


3.2. Равномерное — все значения одинаково вероятны

Явление: время рождения ребёнка в течение суток.

X \sim U(a, b), \qquad f(x) = \frac{1}{b-a} \ \text{ при } x \in [a, b]

f(x)= \begin{cases} \dfrac{1}{b-a}, & a\le x\le b,\\ 0, & \text{иначе}, \end{cases} \qquad F(x)= \begin{cases} 0, & x<a,\\ \dfrac{x-a}{b-a}, & a\le x<b,\\ 1, & x\ge b. \end{cases}

Плотность равномерного распределения на отрезке

МатожиданиеДисперсия
\mathbb{E}(X) = \dfrac{a+b}{2}\mathrm{Var}(X) = \dfrac{(b-a)^2}{12}

Обе формулы выведены в уроке 1.4.


3.3. Нормальное — колокол

Явление: погрешность весов. Рост людей. Ошибки измерений. И огромное количество всего остального.

X \sim N(\mu, \sigma^2)

f(x) = \frac{1}{\sigma\sqrt{2\pi}} \, e^{-\frac{(x-\mu)^2}{2\sigma^2}}

F(x)=\Phi\!\left(\frac{x-\mu}{\sigma}\right),

где \Phi(z) — функция распределения стандартной нормальной величины Z\sim N(0,1). Стандартизация переводит любую нормальную величину к стандартной:

Z=\frac{X-\mu}{\sigma}\sim N(0,1).

Нормальное распределение для разных параметров

Параметры прямо равны характеристикам — редкое удобство:

ПараметрЧто этоЧто делает с графиком
μ\muматожидание \mathbb{E}(X)двигает колокол влево-вправо
\sigma^2дисперсия \mathrm{Var}(X)расплющивает: больше дисперсия — площе колокол и непредсказуемее величина

[!important] У нормального распределения нет аналитической функции распределения Интеграл \int_{-\infty}^{x} e^{-t^2/2}\,dt не берётся в элементарных функциях. Поэтому F(x) для нормального распределения всегда считают численно, по приближениям. Исторически для этого печатали таблицы, сегодня это scipy.stats.norm.cdf().

Правило трёх сигм

Правило трёх сигм для нормального распределения

ИнтервалВероятность попасть
\mu \pm 1\sigma≈ 68,3 %
\mu \pm 2\sigma≈ 95,4 %
\mu \pm 3\sigma≈ 99,7 %

Полезно как быстрая прикидка: значение, отстоящее от среднего больше чем на 3\sigma, для нормальной величины — событие примерно раз на 370 наблюдений.

Свойства нормального распределения подробно разбираются на следующей неделе.


4. Сводные таблицы

4.1. Формулы распределений
РаспределениеНосительPMF или PDFCDF на носителе
Бернуллиk\in\{0,1\}\mathbb{P}(X=k)=p^k(1-p)^{1-k}1-p при 0\le x<1; 11 при x\ge1
Биномиальноеk=0,\dots,n\mathbb{P}(X=k)=C_n^kp^k(1-p)^{n-k}\displaystyle\sum_{k=0}^{\lfloor x\rfloor}C_n^kp^k(1-p)^{n-k}
Геометрическоеk=1,2,\dots\mathbb{P}(X=k)=p(1-p)^{k-1}1-(1-p)^{\lfloor x\rfloor}
Пуассонk=0,1,2,\dots\mathbb{P}(X=k)=\dfrac{\lambda^ke^{-\lambda}}{k!}\displaystyle e^{-\lambda}\sum_{k=0}^{\lfloor x\rfloor}\dfrac{\lambda^k}{k!}
Экспоненциальноеx\ge0f(x)=\lambda e^{-\lambda x}F(x)=1-e^{-\lambda x}
Равномерноеx\in[a,b]f(x)=\dfrac1{b-a}F(x)=\dfrac{x-a}{b-a}
Нормальноеx\in\mathbb{R}f(x)=\dfrac1{\sigma\sqrt{2\pi}}e^{-\frac{(x-\mu)^2}{2\sigma^2}}F(x)=\Phi\!\left(\dfrac{x-\mu}{\sigma}\right)

Вне носителя плотность или вероятность равна нулю; функция распределения равна нулю левее носителя и единице правее него.

4.2. Смысл и характеристики
РаспределениеЧто моделируетПараметры\mathbb{E}(X)\mathrm{Var}(X)scipy
Бернуллиодин опыт, два исходаppppp(1-p)bernoulli
Биномиальноечисло успехов из nnn, pnpnp(1-p)binom
Геометрическоеномер первого успехаpp1/p(1-p)/p^2geom
Пуассончисло событий за интервалλ\lambdaλ\lambdaλ\lambdapoisson
Экспоненциальноевремя до событияλ\lambda1/\lambda1/\lambda^2expon
Равномерноевсе значения равновероятныa, b(a+b)/2(b-a)^2/12uniform
Нормальноесимметричный разброс, ошибки, суммы\mu, \sigma^2μ\mu\sigma^2norm

5. Как выбрать распределение

graph TD
    A{"Что измеряем?"} --> B["Считаем ШТУКИ<br/>дискретная величина"]
    A --> C["Измеряем ВРЕМЯ<br/>или физическую величину<br/>непрерывная"]

    B --> B1{"Сколько опытов?"}
    B1 -->|"один"| D1["Бернулли<br/>Bern p"]
    B1 -->|"фиксированное n"| D2["Биномиальное<br/>Bin n, p"]
    B1 -->|"ждём первого успеха"| D3["Геометрическое<br/>Geom p"]
    B1 -->|"считаем события<br/>за интервал"| D4["Пуассон<br/>Pois λ"]

    C --> C1{"Что именно?"}
    C1 -->|"время до события"| E1["Экспоненциальное<br/>Exp λ"]
    C1 -->|"все значения<br/>равновероятны"| E2["Равномерное<br/>U a, b"]
    C1 -->|"симметричный разброс<br/>вокруг центра"| E3["Нормальное<br/>N μ, σ²"]

6. Как распределения связаны между собой

Это не отдельные формулы, а одно семейство.

graph LR
    B["Бернулли<br/>один опыт"] -->|"сумма n штук"| BIN["Биномиальное"]
    B -->|"ждём первого<br/>успеха"| G["Геометрическое"]
    BIN -->|"n → ∞, p → 0<br/>при np = λ"| P["Пуассон"]
    BIN -->|"n большое,<br/>p не крайнее (ЦПТ)"| N["Нормальное"]
    P -->|"интервалы между<br/>событиями"| E["Экспоненциальное"]
    G -.->|"непрерывный аналог"| E
    P -->|"λ большое"| N
    ANY["Любая величина<br/>с конечной дисперсией"] -->|"среднее большой выборки<br/>ЦПТ"| N

[!info] Расширение: три связи, которые стоит понимать

1. Пуассон как предел биномиального. Возьмите очень много испытаний с очень маленькой вероятностью успеха так, чтобы произведение np = \lambda оставалось постоянным. Получится Пуассон. Смысл: событий-возможностей бесконечно много, каждая почти невероятна, но в сумме что-то за час да произойдёт — это и есть «счётчик».

2. Пуассон и экспоненциальное — две стороны одного процесса. Если число событий за интервал распределено по Пуассону с интенсивностью λ\lambda, то время между соседними событиями распределено экспоненциально с той же λ\lambda. Одно явление, два вопроса: «сколько штук» и «сколько ждать».

3. Геометрическое — дискретный аналог экспоненциального. Оба отвечают «сколько ждать до первого успеха», оба обладают отсутствием памяти. Разница только в том, что время идёт шагами или непрерывно.

4. Нормальное как универсальный предел. По центральной предельной теореме среднее большой выборки из почти любого распределения ведёт себя как нормальное. Отсюда и фраза из урока 1.1 про «лезет из всех щелей».


7. Это же на Python

import numpy as np
from scipy import stats

rng = np.random.default_rng(42)

# ---------- Дискретные ----------
stats.bernoulli(p=0.6).rvs(10, random_state=rng)        # 0/1
stats.binom(n=10, p=0.3).pmf(3)                          # P(ровно 3 попадания из 10)
stats.binom(n=10, p=0.3).cdf(3)                          # P(не больше 3 попаданий)
stats.geom(p=0.2).mean()                                 # 5.0 — в среднем 5 бросков
stats.poisson(mu=4).pmf(2)                               # P(ровно 2 события), mu = λ

# ---------- Непрерывные ----------
# ВНИМАНИЕ: у scipy expon параметризуется через scale = 1/λ, а не через λ
lam = 2.0
X = stats.expon(scale=1 / lam)
X.mean()                                                 # 0.5 = 1/λ
X.cdf(1)                                                 # P(ждать не больше 1)

stats.uniform(loc=0, scale=24).mean()                    # 12.0 — loc=a, scale=b-a
stats.norm(loc=170, scale=10).cdf(180)                   # ≈ 0.841

# ---------- Проверяем связь Бернулли → биномиальное ----------
n, p = 10, 0.3
bern_sum = rng.binomial(1, p, size=(100_000, n)).sum(axis=1)   # сумма n бернуллиевских
binom    = rng.binomial(n, p, size=100_000)                    # напрямую биномиальное
print(bern_sum.mean(), binom.mean())      # ≈ 3.0 и ≈ 3.0 — совпадает

# ---------- Проверяем правило трёх сигм ----------
z = rng.normal(0, 1, 1_000_000)
for k in (1, 2, 3):
    print(k, np.mean(np.abs(z) < k))      # ≈ 0.683, 0.954, 0.997

# ---------- Проверяем отсутствие памяти у экспоненциального ----------
t = rng.exponential(scale=1 / lam, size=1_000_000)
waited = t[t > 1.0] - 1.0                 # уже прождали 1, смотрим остаток
print(t.mean(), waited.mean())            # ≈ 0.5 и ≈ 0.5 — распределение то же

[!danger] Ловушка параметризации в scipy scipy.stats.expon принимает scale = 1/\lambda, а не λ\lambda. Забыть про это — классическая ошибка, которая тихо даёт неверные числа. Проверяйте себя вызовом .mean(): он должен совпасть с тем, что вы ожидаете.


8. Главное предупреждение урока

[!important] Модель — не истина Всё перечисленное — лишь способы описать явление, задуманное «сундуком». Конкретный закон выбирается из двух источников:

  1. того, что видно в данных;

  2. здравого смысла о том, как реальность устроена.

Ни одно из этих распределений не является истиной в последней инстанции. Реальные явления часто отклоняются от предложенных моделей, и тогда модель приходится подбирать другую.

Как проверять предпосылки о сундуке — предмет всего остального курса.

Примеры, где «очевидная» модель ломается:

ЯвлениеНаивная модельЧто не так на практике
Время рождения ребёнкаU(0, 24)Плановые кесаревы сечения сдвигают массу к рабочим часам
Время прихода автобуса\mathrm{Exp}(\lambda)Расписание — память есть, экспоненциальное не подходит
Число лайков\mathrm{Pois}(\lambda)Всплески и вирусность дают дисперсию много больше среднего
Рост людейN(\mu, \sigma^2)В смешанной по полу выборке распределение бимодально

Проверь себя

<details> <summary>Чем отличаются Бернулли, биномиальное и геометрическое?</summary>

Все три про серию одинаковых опытов с двумя исходами, но отвечают на разные вопросы. Бернулли — результат одного опыта. Биномиальное — сколько успехов в nn опытах. Геометрическое — на каком по счёту опыте случился первый успех. </details>

<details> <summary>Почему E\mathbb{E} и \mathrm{Var} биномиального — это просто nn раз Бернулли?</summary>

Потому что биномиальная величина есть сумма nn независимых бернуллиевских. Матожидание суммы всегда равно сумме матожиданий, а дисперсии складываются благодаря независимости. Отсюда np и np(1-p). </details>

<details> <summary>Что означает параметр λ у Пуассона?</summary>

Интенсивность потока: среднее число событий за выбранный интервал. Он же равен и матожиданию, и дисперсии. </details>

<details> <summary>Как быстро проверить, подходит ли Пуассон к вашим данным?</summary>

Сравнить выборочное среднее и выборочную дисперсию. У Пуассона они равны. Сильное расхождение (обычно дисперсия больше) означает, что интенсивность непостоянна и модель не годится. </details>

<details> <summary>Что такое отсутствие памяти и где оно не работает?</summary>

\mathbb{P}(X > s+t \mid X > s) = \mathbb{P}(X > t): уже прождавшее время не влияет на оставшееся. Не работает там, где есть расписание или износ — автобусы по графику, стареющее оборудование. </details>

<details> <summary>Почему для нормального распределения нет формулы функции распределения?</summary>

Интеграл от e^{-t^2/2} не выражается в элементарных функциях. F(x) считают численно — исторически по таблицам, сейчас через scipy.stats.norm.cdf. </details>

<details> <summary>Как связаны Пуассон и экспоненциальное?</summary>

Это один процесс с двух сторон. Число событий за интервал — Пуассон с интенсивностью λ\lambda; время между соседними событиями — экспоненциальное с той же λ\lambda. </details>

<details> <summary>Главный дисклеймер урока?</summary>

Распределение — модель, а не истина. Выбор делается по данным и здравому смыслу, и реальные явления регулярно от моделей отклоняются. Проверка предпосылок — содержание дальнейшего курса. </details>


Навигация

  • Предыдущий урок: 1.4 Характеристики случайных величин

  • Оглавление курса: 00 Курс — оглавление и шпаргалка

  1. Распределение Бернулли

    Модель одного опыта с двумя исходами: величина принимает 1 с вероятностью p и 0 с вероятностью 1 − p

  2. Матожидание и дисперсия распределения Бернулли

    E(X) = p, Var(X) = p(1 − p)

  3. При каком p величина Бернулли наименее предсказуема?

    При p = 0,5: дисперсия p(1 − p) достигает максимума 0,25

    Подсказка: Честная монета или монета, выпадающая орлом в 99 процентах бросков?

  4. Биномиальное распределение

    Модель числа успехов в n независимых одинаковых испытаниях с вероятностью успеха p

  5. Матожидание и дисперсия биномиального распределения

    E(X) = np, Var(X) = np(1 − p)

  6. Как биномиальная величина связана с бернуллиевской?

    Она равна сумме n независимых бернуллиевских величин, поэтому её характеристики — характеристики Бернулли, умноженные на n

  7. Зачем в формуле биномиального распределения нужен биномиальный коэффициент?

    Он учитывает число способов расположить k успехов среди n испытаний, поскольку порядок успехов неважен

  8. Геометрическое распределение

    Модель номера испытания, на котором произошёл первый успех

  9. Матожидание и дисперсия геометрического распределения (номер первого успеха)

    E(X) = 1/p, Var(X) = (1 − p)/p²

  10. Распределение Пуассона

    Модель числа событий, произошедших за фиксированный интервал времени или пространства

  11. Что означает параметр лямбда в распределении Пуассона?

    Интенсивность потока событий: среднее число событий за рассматриваемый интервал

  12. Матожидание и дисперсия распределения Пуассона

    И матожидание, и дисперсия равны лямбда

  13. Как быстро проверить, подходит ли пуассоновская модель к данным?

    Сравнить выборочные среднее и дисперсию: у Пуассона они равны, сильное расхождение означает непригодность модели

  14. Сверхдисперсия

    Ситуация, когда дисперсия счётчика заметно превышает его среднее; признак того, что интенсивность событий непостоянна

  15. Экспоненциальное распределение

    Модель времени ожидания до наступления события

  16. Плотность и матожидание экспоненциального распределения

    f(x) = лямбда·e^(−лямбда·x) при x ≥ 0; E(X) = 1/лямбда

  17. Свойство отсутствия памяти

    Уже потраченное на ожидание время не влияет на распределение оставшегося: P(X > s + t при условии X > s) = P(X > t)

  18. Назовите случай, когда свойство отсутствия памяти не выполняется на практике

    Автобусы по расписанию или изнашивающееся оборудование: чем дольше ждём или чем старше деталь, тем ближе событие

  19. Равномерное распределение

    Модель, в которой все значения на отрезке от a до b равновероятны, а плотность постоянна

  20. Матожидание и дисперсия равномерного распределения на отрезке от a до b

    E(X) = (a + b)/2, Var(X) = (b − a)²/12

  21. Нормальное распределение

    Распределение с колоколообразной плотностью, параметры которого мю и сигма² равны его матожиданию и дисперсии

  22. Как параметры мю и сигма меняют график нормальной плотности?

    Мю двигает колокол вдоль оси, сигма его расплющивает: чем больше сигма, тем площе кривая и непредсказуемее величина

  23. Почему у нормального распределения нет аналитической функции распределения?

    Нужный интеграл не выражается в элементарных функциях, поэтому F(x) считают численно, по приближениям

  24. Правило трёх сигм

    В интервал мю ± сигма попадает около 68 % вероятности, в мю ± 2 сигма — около 95 %, в мю ± 3 сигма — около 99,7 %

  25. Как связаны распределение Пуассона и экспоненциальное распределение?

    Это один процесс с двух сторон: число событий за интервал распределено по Пуассону, а время между соседними событиями — экспоненциально с той же лямбда

  26. Главное предостережение урока о выборе распределения

    Распределение — это модель, а не истина: его выбирают по данным и здравому смыслу, и реальные явления регулярно от моделей отклоняются

  27. Функция вероятности распределения Бернулли

    P(X = k) = p^k(1 − p)^(1 − k), где k ∈ {0, 1}

  28. Функция вероятности биномиального распределения

    P(X = k) = C(n, k) p^k(1 − p)^(n − k), где k = 0, …, n

  29. Две параметризации геометрического распределения

    Можно считать номер первого успеха: k = 1, 2, … и E(X) = 1/p; либо число неудач до успеха: k = 0, 1, … и E(X) = (1 − p)/p

  30. Условия корректности произвольного дискретного распределения

    Для вероятностей pᵢ = P(X = xᵢ) должны выполняться pᵢ ≥ 0 и Σpᵢ = 1

  31. Матожидание и дисперсия произвольной дискретной величины

    E(X) = Σxᵢpᵢ; Var(X) = Σxᵢ²pᵢ − [E(X)]²

  32. Функция вероятности распределения Пуассона

    P(X = k) = λ^k e^(−λ) / k!, где k = 0, 1, 2, …

  33. Функция выживания экспоненциального распределения

    P(X > x) = 1 − F(x) = e^(−λx) при x ≥ 0

  34. Стандартизация нормальной случайной величины

    Если X ~ N(μ, σ²), то Z = (X − μ)/σ ~ N(0, 1)

  35. Параметризация scipy.stats.expon через интенсивность λ

    Нужно передать scale = 1/λ; проверка: среднее распределения должно равняться 1/λ

  36. Параметры scipy.stats.uniform для распределения U(a, b)

    loc = a, scale = b − a

  37. Когда биномиальное распределение приближается распределением Пуассона?

    При n → ∞ и p → 0, если произведение np = λ остаётся постоянным

  38. Связь геометрического и экспоненциального распределений

    Оба описывают ожидание до первого события и обладают отсутствием памяти; геометрическое считает дискретные шаги, экспоненциальное — непрерывное время

Показано 38 из 38 карточек

Сбор и анализ данных в Python — неделя 1: основы теории вероятностей — Remora