tags:
1.5 Какими бывают случайные величины
[!abstract] Коротко
Распределение — это модель явления, а не его истинное устройство. Выбирают её из данных и здравого смысла.
Дискретные: Бернулли (один опыт), биномиальное (сколько успехов из n), геометрическое (когда первый успех), Пуассон (сколько событий за интервал).
Непрерывные: экспоненциальное (сколько ждать), равномерное (все значения равновероятны), нормальное (колокол, «всё остальное»).
Распределения связаны между собой: биномиальное — это сумма бернуллиевских, Пуассон — предел биномиального, и так далее.
Экспоненциальное обладает отсутствием памяти: сколько уже прождали — неважно.
Финальное предупреждение урока: любая из этих моделей — не истина в последней инстанции.
1. Логика урока
В уроке 1.2 появился «сундук» — неизвестный процесс порождения данных. В уроке 1.3 мы научились описывать содержимое сундука одной случайной величиной. Здесь — каталог готовых моделей: какое явление каким распределением разумно описывать.
2. Дискретные распределения
2.1. Бернулли — один опыт с двумя исходами
Явление: пол новорождённого. Подбрасывание монеты. Кликнул пользователь или нет.
X \sim \mathrm{Bern}(p)
\mathbb{P}(X = 1) = p \quad (\text{успех}), \qquad \mathbb{P}(X = 0) = 1 - p \quad (\text{неудача})
Функция распределения:
F(x)=\mathbb{P}(X\le x)=
\begin{cases}
0, & x<0,\\
1-p, & 0\le x<1,\\
1, & x\ge 1.
\end{cases}

Единицу и ноль можно приписать любым интересующим нас событиям — «успех» и «неудача» здесь чисто технические ярлыки, без оценочного смысла. В примере с ребёнком: девочка — 1, мальчик — 0.
| Параметр | Матожидание | Дисперсия |
|---|
| p — вероятность успеха | \mathbb{E}(X) = p | \mathrm{Var}(X) = p(1-p) |
[!tip] Когда Бернулли непредсказуемее всего \mathrm{Var} = p(1-p) максимальна при p = 0{,}5 (равна 0,25) и стремится к нулю на краях. Честная монета — самый непредсказуемый исход. Монета, выпадающая орлом в 99 % случаев, почти детерминирована.
2.2. Биномиальное — сколько успехов из n попыток
Явление: число попаданий в баскетбольную корзину из n бросков. Сколько из 1000 посетителей сайта оформили заказ.
X \sim \mathrm{Bin}(n, p)
\mathbb{P}(X = k) = C_n^k \, p^k (1-p)^{n-k}, \qquad k = 0, 1, \dots, n
F(x)=\sum_{k=0}^{\lfloor x\rfloor} C_n^k p^k(1-p)^{n-k},
\qquad 0\le x<n,
причём F(x)=0 при x<0 и F(x)=1 при x\ge n.
где C_n^k — биномиальный коэффициент:
C_n^k = \frac{n!}{k!\,(n-k)!}
Чем больше p, тем правее смещается масса распределения.
[!info] Откуда берётся формула Разберём по кусочкам — так она перестаёт быть заклинанием:
p^k — вероятность k попаданий подряд;
(1-p)^{n-k} — вероятность остальных n-k промахов;
C_n^k — сколькими способами эти k попаданий могут распределиться среди n бросков.
Последний множитель нужен потому, что нам неважен порядок: «попал-промазал-попал» и «попал-попал-промазал» — оба дают 2 попадания из 3.
Связь с Бернулли
Один бросок — это испытание Бернулли. Общее число попаданий — сумма таких испытаний:
X_{\mathrm{Bin}} = \underbrace{X_1 + X_2 + \dots + X_n}_{\text{каждое } X_i \sim \mathrm{Bern}(p),\ \text{независимы}}
Отсюда характеристики выводятся мгновенно через свойства из урока 1.4 — матожидания складываются всегда, дисперсии складываются, потому что броски независимы:
| Матожидание | Дисперсия |
|---|
| \mathbb{E}(X) = np | \mathrm{Var}(X) = np(1-p) |
То есть просто характеристики Бернулли, умноженные на n.
2.3. Геометрическое — номер первого успеха
Явление: на каком по счёту броске впервые попали в корзину. Сколько писем отправили до первого ответа.
X \sim \mathrm{Geom}(p)
\mathbb{P}(X = k) = (1-p)^{k-1} \cdot p
F(x)=1-(1-p)^{\lfloor x\rfloor}, \qquad x\ge 1,
а при x<1 имеем F(x)=0.
Формула читается буквально: k-1 раз промахнулись (отсюда (1-p)^{k-1}), затем один раз попали (отсюда p).

Величина принимает счётное бесконечное множество значений: промахиваться можно сколь угодно долго.
| Матожидание | Дисперсия |
|---|
| \mathbb{E}(X) = \dfrac{1}{p} | \mathrm{Var}(X) = \dfrac{1-p}{p^2} |
\mathbb{E}(X) = 1/p интуитивно понятно: при вероятности попадания 0,2 в среднем нужно 5 бросков.
[!warning] Две параметризации — источник путаницы Геометрическое распределение задают двумя способами, и они дают разные ответы:
| Что считаем | Носитель | \mathbb{E}(X) | В Python |
|---|
| Номер первого успеха | k = 1, 2, 3, \dots | 1/p | stats.geom |
| Число неудач до успеха | k = 0, 1, 2, \dots | (1-p)/p | np.random.geometric минус 1 |
В лекции используется формула (1-p)^{k-1}p и \mathbb{E} = 1/p — это первый вариант, значения с единицы. Прежде чем брать формулу из справочника, всегда проверяйте, с чего начинается носитель.
На слайде рядом с этой формулой указано k=0,1,2,\dots — это опечатка: выражение (1-p)^{k-1}p соответствует k=1,2,3,\dots.
2.4. Произвольное дискретное — просто таблица
Не всё описывается именованным распределением. Игральная кость — это просто таблица из шести строк по 1/6. Функция распределения — ступеньки, каждый раз прыгающие на 1/6, как в уроке 1.3.
Если X принимает значения x_1,x_2,\dots с вероятностями p_1,p_2,\dots, то:
p_i=\mathbb{P}(X=x_i), \qquad p_i\ge 0, \qquad \sum_i p_i=1,
F(x)=\mathbb{P}(X\le x)=\sum_{x_i\le x}p_i,
\mathbb{E}(X)=\sum_i x_i p_i,
\mathrm{Var}(X)=\sum_i(x_i-\mathbb{E}X)^2p_i
=\sum_i x_i^2p_i-\bigl(\mathbb{E}X\bigr)^2.
Для честной игральной кости:
| x | 1 | 2 | 3 | 4 | 5 | 6 |
|---|
| \mathbb{P}(X=x) | 1/6 | 1/6 | 1/6 | 1/6 | 1/6 | 1/6 |
Отсюда \mathbb{E}(X)=3{,}5, а \mathrm{Var}(X)=35/12.
2.5. Пуассон — счётчики событий
Явление: всё, что имеет вид «сколько событий произошло за интервал»:
число людей в очереди;
число лайков под фотографией;
число автобусов, проехавших мимо остановки за час;
число персонажей, погибших за главу книги.
X \sim \mathrm{Pois}(\lambda)
\mathbb{P}(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}, \qquad k = 0, 1, 2, \dots
F(x)=e^{-\lambda}\sum_{k=0}^{\lfloor x\rfloor}\frac{\lambda^k}{k!}, \qquad x\ge 0,
а при x<0 имеем F(x)=0.

λ — интенсивность потока событий: среднее число событий за выбранный интервал. Сколько автобусов в среднем за час, сколько смертей в среднем за главу.
| Матожидание | Дисперсия |
|---|
| \mathbb{E}(X) = \lambda | \mathrm{Var}(X) = \lambda |
[!important] Уникальное свойство Пуассона Матожидание и дисперсия совпадают. Это даёт быструю диагностику: посчитайте по своим данным среднее и дисперсию. Если они сильно разошлись — пуассоновская модель не подходит.
Чаще всего дисперсия оказывается больше среднего — это называется сверхдисперсией (overdispersion) и означает, что интенсивность λ сама не постоянна: лайки идут всплесками, очередь в обед не такая, как в 11 утра.
3. Непрерывные распределения
3.1. Экспоненциальное — сколько ждать до события
Явление: «время до чего-то»:
время до прихода трамвая;
время до появления следующего человека в очереди;
время до поломки механизма.
X \sim \mathrm{Exp}(\lambda)
f(x) = \lambda e^{-\lambda x}, \quad x \ge 0 \qquad\qquad F(x) = 1 - e^{-\lambda x}
Полностью, с учётом области значений:
f(x)=
\begin{cases}
\lambda e^{-\lambda x}, & x\ge 0,\\
0, & x<0,
\end{cases}
\qquad
F(x)=
\begin{cases}
1-e^{-\lambda x}, & x\ge 0,\\
0, & x<0.
\end{cases}
Вероятность ждать дольше x — функция выживания:
\mathbb{P}(X>x)=1-F(x)=e^{-\lambda x}.

Проверка связи из урока 1.3: производная от F(x) = 1 - e^{-\lambda x} равна \lambda e^{-\lambda x} — это ровно плотность. ✓
| Матожидание | Дисперсия |
|---|
| \mathbb{E}(X) = \dfrac{1}{\lambda} | \mathrm{Var}(X) = \dfrac{1}{\lambda^2} |
Чем меньше λ, тем дольше в среднем ждём. Время непрерывно — в отличие от числа событий, поэтому здесь плотность, а не таблица.
Свойство отсутствия памяти
\mathbb{P}(X > s + t \mid X > s) = \mathbb{P}(X > t)
Словами: если автобусы приходят по экспоненциальному закону и вы уже прождали 20 минут, это ничего не говорит о том, сколько ждать дальше. Распределение оставшегося времени такое же, как в момент прихода на остановку.
[!warning] Расширение: где это свойство ломается Отсутствие памяти — сильное допущение, и на практике оно часто неверно:
Автобусы по расписанию. Прождали 20 минут при интервале 15 — автобус вот-вот придёт. Память есть.
Износ оборудования. Деталь, отработавшая 10 лет, сломается скорее новой. Память есть. Для таких случаев берут распределение Вейбулла.
Радиоактивный распад, звонки в колл-центр, отказы электроники. Здесь памяти действительно нет — экспоненциальное подходит.
Экспоненциальное — базовый кирпич: на нём строятся более сложные модели времени жизни (survival analysis).
3.2. Равномерное — все значения одинаково вероятны
Явление: время рождения ребёнка в течение суток.
X \sim U(a, b), \qquad f(x) = \frac{1}{b-a} \ \text{ при } x \in [a, b]
f(x)=
\begin{cases}
\dfrac{1}{b-a}, & a\le x\le b,\\
0, & \text{иначе},
\end{cases}
\qquad
F(x)=
\begin{cases}
0, & x<a,\\
\dfrac{x-a}{b-a}, & a\le x<b,\\
1, & x\ge b.
\end{cases}

| Матожидание | Дисперсия |
|---|
| \mathbb{E}(X) = \dfrac{a+b}{2} | \mathrm{Var}(X) = \dfrac{(b-a)^2}{12} |
Обе формулы выведены в уроке 1.4.
3.3. Нормальное — колокол
Явление: погрешность весов. Рост людей. Ошибки измерений. И огромное количество всего остального.
X \sim N(\mu, \sigma^2)
f(x) = \frac{1}{\sigma\sqrt{2\pi}} \, e^{-\frac{(x-\mu)^2}{2\sigma^2}}
F(x)=\Phi\!\left(\frac{x-\mu}{\sigma}\right),
где \Phi(z) — функция распределения стандартной нормальной величины Z\sim N(0,1). Стандартизация переводит любую нормальную величину к стандартной:
Z=\frac{X-\mu}{\sigma}\sim N(0,1).

Параметры прямо равны характеристикам — редкое удобство:
| Параметр | Что это | Что делает с графиком |
|---|
| μ | матожидание \mathbb{E}(X) | двигает колокол влево-вправо |
| \sigma^2 | дисперсия \mathrm{Var}(X) | расплющивает: больше дисперсия — площе колокол и непредсказуемее величина |
[!important] У нормального распределения нет аналитической функции распределения Интеграл \int_{-\infty}^{x} e^{-t^2/2}\,dt не берётся в элементарных функциях. Поэтому F(x) для нормального распределения всегда считают численно, по приближениям. Исторически для этого печатали таблицы, сегодня это scipy.stats.norm.cdf().
Правило трёх сигм

| Интервал | Вероятность попасть |
|---|
| \mu \pm 1\sigma | ≈ 68,3 % |
| \mu \pm 2\sigma | ≈ 95,4 % |
| \mu \pm 3\sigma | ≈ 99,7 % |
Полезно как быстрая прикидка: значение, отстоящее от среднего больше чем на 3\sigma, для нормальной величины — событие примерно раз на 370 наблюдений.
Свойства нормального распределения подробно разбираются на следующей неделе.
4. Сводные таблицы
4.1. Формулы распределений
| Распределение | Носитель | PMF или PDF | CDF на носителе |
|---|
| Бернулли | k\in\{0,1\} | \mathbb{P}(X=k)=p^k(1-p)^{1-k} | 1-p при 0\le x<1; 1 при x\ge1 |
| Биномиальное | k=0,\dots,n | \mathbb{P}(X=k)=C_n^kp^k(1-p)^{n-k} | \displaystyle\sum_{k=0}^{\lfloor x\rfloor}C_n^kp^k(1-p)^{n-k} |
| Геометрическое | k=1,2,\dots | \mathbb{P}(X=k)=p(1-p)^{k-1} | 1-(1-p)^{\lfloor x\rfloor} |
| Пуассон | k=0,1,2,\dots | \mathbb{P}(X=k)=\dfrac{\lambda^ke^{-\lambda}}{k!} | \displaystyle e^{-\lambda}\sum_{k=0}^{\lfloor x\rfloor}\dfrac{\lambda^k}{k!} |
| Экспоненциальное | x\ge0 | f(x)=\lambda e^{-\lambda x} | F(x)=1-e^{-\lambda x} |
| Равномерное | x\in[a,b] | f(x)=\dfrac1{b-a} | F(x)=\dfrac{x-a}{b-a} |
| Нормальное | x\in\mathbb{R} | f(x)=\dfrac1{\sigma\sqrt{2\pi}}e^{-\frac{(x-\mu)^2}{2\sigma^2}} | F(x)=\Phi\!\left(\dfrac{x-\mu}{\sigma}\right) |
Вне носителя плотность или вероятность равна нулю; функция распределения равна нулю левее носителя и единице правее него.
4.2. Смысл и характеристики
| Распределение | Что моделирует | Параметры | \mathbb{E}(X) | \mathrm{Var}(X) | scipy |
|---|
| Бернулли | один опыт, два исхода | p | p | p(1-p) | bernoulli |
| Биномиальное | число успехов из n | n, p | np | np(1-p) | binom |
| Геометрическое | номер первого успеха | p | 1/p | (1-p)/p^2 | geom |
| Пуассон | число событий за интервал | λ | λ | λ | poisson |
| Экспоненциальное | время до события | λ | 1/\lambda | 1/\lambda^2 | expon |
| Равномерное | все значения равновероятны | a, b | (a+b)/2 | (b-a)^2/12 | uniform |
| Нормальное | симметричный разброс, ошибки, суммы | \mu, \sigma^2 | μ | \sigma^2 | norm |
5. Как выбрать распределение
graph TD
A{"Что измеряем?"} --> B["Считаем ШТУКИ<br/>дискретная величина"]
A --> C["Измеряем ВРЕМЯ<br/>или физическую величину<br/>непрерывная"]
B --> B1{"Сколько опытов?"}
B1 -->|"один"| D1["Бернулли<br/>Bern p"]
B1 -->|"фиксированное n"| D2["Биномиальное<br/>Bin n, p"]
B1 -->|"ждём первого успеха"| D3["Геометрическое<br/>Geom p"]
B1 -->|"считаем события<br/>за интервал"| D4["Пуассон<br/>Pois λ"]
C --> C1{"Что именно?"}
C1 -->|"время до события"| E1["Экспоненциальное<br/>Exp λ"]
C1 -->|"все значения<br/>равновероятны"| E2["Равномерное<br/>U a, b"]
C1 -->|"симметричный разброс<br/>вокруг центра"| E3["Нормальное<br/>N μ, σ²"]
6. Как распределения связаны между собой
Это не отдельные формулы, а одно семейство.
graph LR
B["Бернулли<br/>один опыт"] -->|"сумма n штук"| BIN["Биномиальное"]
B -->|"ждём первого<br/>успеха"| G["Геометрическое"]
BIN -->|"n → ∞, p → 0<br/>при np = λ"| P["Пуассон"]
BIN -->|"n большое,<br/>p не крайнее (ЦПТ)"| N["Нормальное"]
P -->|"интервалы между<br/>событиями"| E["Экспоненциальное"]
G -.->|"непрерывный аналог"| E
P -->|"λ большое"| N
ANY["Любая величина<br/>с конечной дисперсией"] -->|"среднее большой выборки<br/>ЦПТ"| N
[!info] Расширение: три связи, которые стоит понимать
1. Пуассон как предел биномиального. Возьмите очень много испытаний с очень маленькой вероятностью успеха так, чтобы произведение np = \lambda оставалось постоянным. Получится Пуассон. Смысл: событий-возможностей бесконечно много, каждая почти невероятна, но в сумме что-то за час да произойдёт — это и есть «счётчик».
2. Пуассон и экспоненциальное — две стороны одного процесса. Если число событий за интервал распределено по Пуассону с интенсивностью λ, то время между соседними событиями распределено экспоненциально с той же λ. Одно явление, два вопроса: «сколько штук» и «сколько ждать».
3. Геометрическое — дискретный аналог экспоненциального. Оба отвечают «сколько ждать до первого успеха», оба обладают отсутствием памяти. Разница только в том, что время идёт шагами или непрерывно.
4. Нормальное как универсальный предел. По центральной предельной теореме среднее большой выборки из почти любого распределения ведёт себя как нормальное. Отсюда и фраза из урока 1.1 про «лезет из всех щелей».
7. Это же на Python
import numpy as np
from scipy import stats
rng = np.random.default_rng(42)
# ---------- Дискретные ----------
stats.bernoulli(p=0.6).rvs(10, random_state=rng) # 0/1
stats.binom(n=10, p=0.3).pmf(3) # P(ровно 3 попадания из 10)
stats.binom(n=10, p=0.3).cdf(3) # P(не больше 3 попаданий)
stats.geom(p=0.2).mean() # 5.0 — в среднем 5 бросков
stats.poisson(mu=4).pmf(2) # P(ровно 2 события), mu = λ
# ---------- Непрерывные ----------
# ВНИМАНИЕ: у scipy expon параметризуется через scale = 1/λ, а не через λ
lam = 2.0
X = stats.expon(scale=1 / lam)
X.mean() # 0.5 = 1/λ
X.cdf(1) # P(ждать не больше 1)
stats.uniform(loc=0, scale=24).mean() # 12.0 — loc=a, scale=b-a
stats.norm(loc=170, scale=10).cdf(180) # ≈ 0.841
# ---------- Проверяем связь Бернулли → биномиальное ----------
n, p = 10, 0.3
bern_sum = rng.binomial(1, p, size=(100_000, n)).sum(axis=1) # сумма n бернуллиевских
binom = rng.binomial(n, p, size=100_000) # напрямую биномиальное
print(bern_sum.mean(), binom.mean()) # ≈ 3.0 и ≈ 3.0 — совпадает
# ---------- Проверяем правило трёх сигм ----------
z = rng.normal(0, 1, 1_000_000)
for k in (1, 2, 3):
print(k, np.mean(np.abs(z) < k)) # ≈ 0.683, 0.954, 0.997
# ---------- Проверяем отсутствие памяти у экспоненциального ----------
t = rng.exponential(scale=1 / lam, size=1_000_000)
waited = t[t > 1.0] - 1.0 # уже прождали 1, смотрим остаток
print(t.mean(), waited.mean()) # ≈ 0.5 и ≈ 0.5 — распределение то же
[!danger] Ловушка параметризации в scipy scipy.stats.expon принимает scale = 1/\lambda, а не λ. Забыть про это — классическая ошибка, которая тихо даёт неверные числа. Проверяйте себя вызовом .mean(): он должен совпасть с тем, что вы ожидаете.
8. Главное предупреждение урока
[!important] Модель — не истина Всё перечисленное — лишь способы описать явление, задуманное «сундуком». Конкретный закон выбирается из двух источников:
того, что видно в данных;
здравого смысла о том, как реальность устроена.
Ни одно из этих распределений не является истиной в последней инстанции. Реальные явления часто отклоняются от предложенных моделей, и тогда модель приходится подбирать другую.
Как проверять предпосылки о сундуке — предмет всего остального курса.
Примеры, где «очевидная» модель ломается:
| Явление | Наивная модель | Что не так на практике |
|---|
| Время рождения ребёнка | U(0, 24) | Плановые кесаревы сечения сдвигают массу к рабочим часам |
| Время прихода автобуса | \mathrm{Exp}(\lambda) | Расписание — память есть, экспоненциальное не подходит |
| Число лайков | \mathrm{Pois}(\lambda) | Всплески и вирусность дают дисперсию много больше среднего |
| Рост людей | N(\mu, \sigma^2) | В смешанной по полу выборке распределение бимодально |
Проверь себя
<details> <summary>Чем отличаются Бернулли, биномиальное и геометрическое?</summary>
Все три про серию одинаковых опытов с двумя исходами, но отвечают на разные вопросы. Бернулли — результат одного опыта. Биномиальное — сколько успехов в n опытах. Геометрическое — на каком по счёту опыте случился первый успех. </details>
<details> <summary>Почему E и \mathrm{Var} биномиального — это просто n раз Бернулли?</summary>
Потому что биномиальная величина есть сумма n независимых бернуллиевских. Матожидание суммы всегда равно сумме матожиданий, а дисперсии складываются благодаря независимости. Отсюда np и np(1-p). </details>
<details> <summary>Что означает параметр λ у Пуассона?</summary>
Интенсивность потока: среднее число событий за выбранный интервал. Он же равен и матожиданию, и дисперсии. </details>
<details> <summary>Как быстро проверить, подходит ли Пуассон к вашим данным?</summary>
Сравнить выборочное среднее и выборочную дисперсию. У Пуассона они равны. Сильное расхождение (обычно дисперсия больше) означает, что интенсивность непостоянна и модель не годится. </details>
<details> <summary>Что такое отсутствие памяти и где оно не работает?</summary>
\mathbb{P}(X > s+t \mid X > s) = \mathbb{P}(X > t): уже прождавшее время не влияет на оставшееся. Не работает там, где есть расписание или износ — автобусы по графику, стареющее оборудование. </details>
<details> <summary>Почему для нормального распределения нет формулы функции распределения?</summary>
Интеграл от e^{-t^2/2} не выражается в элементарных функциях. F(x) считают численно — исторически по таблицам, сейчас через scipy.stats.norm.cdf. </details>
<details> <summary>Как связаны Пуассон и экспоненциальное?</summary>
Это один процесс с двух сторон. Число событий за интервал — Пуассон с интенсивностью λ; время между соседними событиями — экспоненциальное с той же λ. </details>
<details> <summary>Главный дисклеймер урока?</summary>
Распределение — модель, а не истина. Выбор делается по данным и здравому смыслу, и реальные явления регулярно от моделей отклоняются. Проверка предпосылок — содержание дальнейшего курса. </details>
Навигация