← yifan.website

模块 1 · 概率 (Probability)

主线:从"什么是概率"出发 → 用集合语言描述样本空间与事件 → 概率的公理化定义 → 古典概型与计数 → 条件概率 → 独立性 → 全概率与 Bayes。这是整门课的地基。

1.1 概率是什么:四种解释

这门课叫 Probability for Statistics(为统计服务的概率)。统计 (statistics) 关心数据的收集、分析、解释,而数据几乎总带有随机性 (randomness);概率论就是给随机性一个数学度量的工具。

直觉 统计常被"误用"——Disraeli 名言:"世上有三种谎言:谎言、该死的谎言,和统计数字。"经典陷阱是 Simpson 悖论 (Simpson's paradox):在总体里成立的关联,分组后可能消失甚至反转
混杂变量 Simpson 悖论的根源是 混杂变量 (confounding variable)——一个同时影响所研究两个变量的"第三变量"。课件例子:被告/受害者种族与死刑判决,受害者种族就是混杂变量。要量化它的影响,需要概率论。

课件给出概率值的四种解释 / 赋值方式(以"掷骰子得 6 的概率 = 1/6"为例):

  • 对称性 (Symmetry):6 个面等可能,故 1/6。
  • 长期相对频率 (Long-term relative frequency):掷很多次,约 1/6 的次数出现 6。
  • 总体比例 (Population proportion):拿大量骰子,约 1/6 显示 6。
  • 主观判断 (Subjective assessment):我"认为"是 1/6。
例·长期相对频率 网球选手去年 1000 个一发进了 750 个,则下一发成功概率 \( \approx \dfrac{750}{1000}=0.75 \)。其严格含义是极限:
\[ \Pr(\text{success}) \approx \lim_{n\to\infty}\frac{n(\text{successes})}{n(\text{trials})} \]
单次结果靠运气,但大量重复后呈现稳定的统计规律
相对频率随试验次数收敛到 0.75
课件模拟图:对"一发成功"做 101 组模拟(试验数 40, 400, …, 40000),纵轴是成功的相对频率。随着试验次数增大,相对频率在剧烈波动后逐渐收敛到红色虚线 0.75。这正是"概率 = 长期相对频率"的可视化,也对应模块 4 将证明的大数定律。
例·知识的不确定性 John 某次检测呈阳性,疾病 D 在人群中患病率 1/1000,检测 95% 准确。"John 患病的概率"不是可重复试验(他要么有要么没有),而是对未知知识的不确定度量,且是一个条件概率(已知阳性这一信息)。关键结论:\( \Pr(A\mid B)\neq \Pr(B\mid A) \)——"患病时检测为阳"和"检测为阳时患病"完全是两回事。

1.2 基本定义:样本空间与事件

先把几个底层词说清楚(每个第一次出现都解释):

  • 实验 (Experiment):获得一个观测结果的过程。
  • 试验 (Trial):执行一次实验的动作。
  • 结果 (Outcome):实验观测到的一个结果。
  • 随机实验 (Random experiment):结果无法确定预测的实验。
定义 1 · 样本空间 样本空间 (sample space / outcome space),记作 \( S \),是一个实验所有可能结果的集合。其中每个结果叫一个样本点 (sample point),常记作 \( \omega \)。

样本空间按"大小"分类:

  • 有限 (finite):如掷两枚硬币观察正反面。
  • 可数无限 (countably infinite):如"首次出现正面需掷几次",\( S=\{1,2,3,\dots\} \)。
  • 离散 (discrete):有限 或 可数无限,统称离散样本空间。
  • 连续 (continuous):如灯泡寿命 \( T\ge 0 \)(1 维),或地震震中 \( (x,y,z) \)(3 维)。
两个提醒 ① 同一实验、不同目的,会有不同的样本空间(看正反面 vs 看正面个数)。② 不同实验可有等价的样本空间("正/反""下雨/不下雨""男/女"都能抽象成 \( \{\text{yes},\text{no}\} \))。
定义 2 · 事件 事件 (event) \( A \) 是样本空间的子集,\( A\subseteq S \)。做一次实验,若结果落在 \( A \) 中,就说"事件 \( A \) 发生了"。

含恰好一个结果的事件叫基本事件 (elementary event);能拆成多个基本事件的叫可分解事件。两个特殊事件:空集 \( \varnothing \) 是不可能事件 (null event),整个 \( S \) 是必然事件 (certain event)

1.3 事件的运算与运算律

事件就是集合,运算和集合完全一致:

  • 包含 \( A\subseteq B \):\( A \) 发生则 \( B \) 必发生(\( A \) 是 \( B \) 的子事件)。对任意 \( A \) 有 \( \varnothing\subseteq A\subseteq S \)。
  • 交 (Intersection) \( A\cap B \)(也写 \( AB \)):"\( A \) 且 \( B \)",两者都发生。
  • 并 (Union) \( A\cup B \):"\( A \) 或 \( B \)",至少一个发生。
  • 补 (Complement) \( A' \):"非 \( A \)"。例如 \( A\cap B' \) = \( A \) 发生但 \( B \) 不发生。
定义 3 · 互斥 / 穷举 / 划分
  • 互斥 (mutually exclusive):\( A\cap B=\varnothing \);多个事件两两互斥即 \( A_i\cap A_j=\varnothing\ (i\neq j) \)。
  • collectively exhaustive(完备/穷举):\( A_1\cup\cdots\cup A_k=S \)。
  • 划分 (partition):既两两互斥、又穷举——把 \( S \) 不重不漏地切块。
运算优先级 1. 补 → 2. 交 → 3. 并/差。

运算律:

  • 交换律:\( A\cup B=B\cup A,\quad A\cap B=B\cap A \)。
  • 结合律:\( A\cup(B\cup C)=(A\cup B)\cup C \) 等。
  • 分配律:\( A\cap(B\cup C)=(A\cap B)\cup(A\cap C) \);\( A\cup(B\cap C)=(A\cup B)\cap(A\cup C) \)。
De Morgan 律
\[ (A\cup B)'=A'\cap B',\qquad (A\cap B)'=A'\cup B' \]
证明思路(第一式):若 \( \omega\in(A\cup B)' \),则 \( \omega\notin A \) 且 \( \omega\notin B \),即 \( \omega\in A' \) 且 \( \omega\in B' \),故 \( \omega\in A'\cap B' \),得 \( (A\cup B)'\subseteq A'\cap B' \);反向同理可证,两边互含即相等。直觉:"不(A或B)" = "既不A也不B"。

1.4 概率的公理化定义与性质

建模的核心目标:给每个事件 \( A \) 赋一个实数 \( P(A) \)。没有放之四海皆准的赋值法,但我们可以从相对频率的性质抽象出公理,反过来用公理推一切。

定义 4 · 概率的三条公理 概率 \( P \) 是把每个事件映到实数的集合函数,满足:
  1. 非负性:\( P(A)\ge 0 \)。
  2. 规范性 (Regularity):\( P(S)=1 \)。
  3. 可数可加性:若 \( A_1,A_2,\dots \) 两两互斥,则
    \[ P\!\left(\bigcup_{i=1}^{\infty}A_i\right)=\sum_{i=1}^{\infty}P(A_i) \]
    (有限并是其特例)。
概率的性质(由公理推出)
  1. \( P(A)=1-P(A') \)。
  2. \( P(\varnothing)=0 \)。
  3. 若 \( A\subseteq B \),则 \( P(A)\le P(B) \)(单调性)。
  4. \( P(A)\le 1 \)。
  5. 加法公式 (容斥):\( P(A\cup B)=P(A)+P(B)-P(A\cap B) \)。
  6. 三事件容斥:
    \[ P(A\cup B\cup C)=P(A)+P(B)+P(C)-P(AB)-P(AC)-P(BC)+P(ABC) \]

1.5 古典概型与计数方法

古典概型 两个特征:① \( S \) 有限;② 所有样本点等可能,\( P(\{\omega_i\})=\frac{1}{n} \)。于是
\[ P(A)=\frac{\#\{A\text{ 中的样本点}\}}{\#\{S\text{ 中的样本点}\}}=\frac{n(A)}{n} \]
求概率就变成数数。常见于赌博、遗传、质检、理论物理。
两条计数原理
  • 乘法原理:步骤 \( A_1 \) 有 \( n_1 \) 种、\( A_2 \) 有 \( n_2 \) 种做法,都做有 \( n_1\times n_2 \) 种。
  • 加法原理:\( A_1 \) 有 \( n_1 \) 种、\( A_2 \) 有 \( n_2 \) 种,二选一有 \( n_1+n_2 \) 种。
(例:20 道判断题答法 \( 2^{20} \);A 到 B 火车 2 条+汽车 3 条共 5 条路。)
排列 (Permutations) 从 \( n \) 个不同物中取 \( r \) 个排成一列讲顺序):
\[ {}_nP_r=\frac{n!}{(n-r)!}=n(n-1)\cdots(n-r+1) \]
组合 (Combinations) 从 \( n \) 个不同物中取 \( r \) 个放进一个"盒子"不讲顺序):
\[ {}_nC_r=\binom{n}{r}=\frac{n!}{r!\,(n-r)!} \]
\( \binom{n}{r} \) 称二项系数,因它出现在二项展开 \( (a+b)^n=\sum_{r=0}^{n}\binom{n}{r}b^r a^{n-r} \) 中。
多项系数 (Multinomial) \( n \) 个物,其中第 1 种 \( r_1 \) 个、…、第 \( k \) 种 \( r_k \) 个(\( \sum r_i=n \)),不同排列数 = 把 \( n \) 个物划入 \( k \) 个盒(各 \( r_i \) 个)的方法数:
\[ \binom{n}{r_1,r_2,\dots,r_k}=\frac{n!}{r_1!\,r_2!\cdots r_k!} \]
课件态度 古典概型的计算可以非常难(见 Feller 的书),且实际应用有限,所以本课不深挖;但必须熟悉这套记号与概率基本性质。

1.6 条件概率与乘法法则

定义 5 · 条件概率 在事件 \( B \) 已发生的前提下,事件 \( A \) 的条件概率 (conditional probability)
\[ P(A\mid B)=\frac{P(A\cap B)}{P(B)},\qquad P(B)>0 \]
直觉 \( P(A\mid B) \) 是"把样本空间缩小到 \( B \)"后,\( A \) 占 \( B \) 的比例。等价地 \( P(A\mid B)=\dfrac{n(A\cap B)/n(S)}{n(B)/n(S)}=\dfrac{n(A\cap B)}{n(B)} \)。哪个事件是"given"(条件),就用它作分母。
公理依然成立 条件概率也满足三条概率公理(如 \( P(B\mid B)=1 \)),以及性质 1–6。
定义 6 · 乘法法则 把定义反过来写:
\[ P(A\cap B)=P(A)\,P(B\mid A)=P(B)\,P(A\mid B) \]
用于"逐步发生"的连续抽取问题(如不放回抽牌)。

1.7 独立事件

定义 7 · 独立 若一个事件发生与否不改变另一个的概率,即 \( P(A\mid B)=P(A) \)(或 \( P(B\mid A)=P(B) \)),则 \( A,B \) 独立。等价的判定式
\[ A,B\text{ 独立}\iff P(A\cap B)=P(A)\,P(B) \]
易混:互斥 ≠ 独立 互斥是 \( A\cap B=\varnothing \)(不能同时发生);独立是 \( P(AB)=P(A)P(B) \)。两个正概率的互斥事件一定独立。另注:若 \( P(A)=0 \) 或 \( P(B)=0 \),则 \( A,B \) 必独立(因 \( P(AB)=0=P(A)P(B) \))。
定理 1 若 \( A,B \) 独立,则 \( (A,B') \)、\( (A',B) \)、\( (A',B') \) 也各自独立。
证 (c):\( P(A'\cap B')=P((A\cup B)')=1-P(A\cup B)=1-P(A)-P(B)+P(A)P(B)=[1-P(A)][1-P(B)]=P(A')P(B') \)。
定义 8/9 · 两两独立 vs 相互独立 两两独立 (pairwise):任意两个满足乘积式。
相互独立 (mutually independent):不仅两两独立,还要求任意子集的交都等于各概率之积,例如三事件还需 \( P(ABC)=P(A)P(B)P(C) \)。
反例·两两独立 ≠ 相互独立 \( S=\{1,2,3,4\} \) 等可能,\( A=\{1,2\},B=\{1,3\},C=\{1,4\} \)。三者两两满足 \( P(\cdot\cap\cdot)=\frac14=P(\cdot)P(\cdot) \),两两独立;但 \( P(ABC)=\frac14\neq\frac18=P(A)P(B)P(C) \),相互独立。
推论 相互独立 ⇒ 两两独立(反之不成立)。相互独立时,由其中一部分事件构成的事件,与由其余部分构成的事件也独立。

1.8 全概率公式与 Bayes 定理

全概率公式 (Law of total probability) 设 \( B_1,\dots,B_k \) 是 \( S \) 的一个划分(两两互斥且穷举)。对任意事件 \( A \):
\[ A=\bigcup_{i=1}^{k}(A\cap B_i)\ \Longrightarrow\ P(A)=\sum_{i=1}^{k}P(A\cap B_i)=\sum_{i=1}^{k}P(B_i)\,P(A\mid B_i) \]
直觉 把复杂事件 \( A \) 的概率,拆成"在各种情形 \( B_i \) 下分别发生"再加总——先分类,再各个击破
定理 2 · Bayes 定理 设 \( B_1,\dots,B_k \) 为 \( S \) 的划分,则对每个 \( j \):
\[ P(B_j\mid A)=\frac{P(B_j)\,P(A\mid B_j)}{\sum_{i=1}^{k}P(B_i)\,P(A\mid B_i)} \]
\( k=2 \) 时分母为 \( P(B_1)P(A\mid B_1)+P(B_2)P(A\mid B_2) \)。
先验与后验 推导 = 条件概率定义 + 乘法法则 + 全概率公式。\( P(B_j) \) 叫先验概率 (prior),\( P(B_j\mid A) \) 叫后验概率 (posterior)——这是 贝叶斯统计 (Bayesian statistics) 的核心。应用时画图(树图/表格)非常有帮助。
例·罕见病的反直觉 宫颈癌患病率仅 \( P(C)=0.00008 \),检测有 16% 漏检、19% 误检。由 Bayes,每百万份阳性中平均只有约 354 例真患病。低患病率 + 检测误差会让"阳性后患病概率"远低于直觉——这正是 1.1 中 \( P(A\mid B)\neq P(B\mid A) \) 的现实意义。

模块 2 · 离散分布 (Discrete distributions)

主线:把"非数值的结果"翻译成数 → 随机变量与 pmf → 期望/方差/矩 → 几个核心离散分布(超几何、二项、几何/负二项、Poisson)→ 用 mgf 统一计算矩。

2.1 随机变量与概率质量函数 (pmf)

定义 1 · 随机变量 给定样本空间 \( S \),把每个 \( s\in S \) 映到一个实数 \( X(s)=x \) 的函数 \( X \) 叫随机变量 (random variable, r.v.)。它的取值范围 (range/space) 记作 \( S_X=\{x:X(s)=x,\,s\in S\} \)。
为什么要它 直接描述非数值的样本空间(如颜色"红黄白")很难。给每个结果配一个数 \( x \),事件 \( B\subseteq S \) 就变成数集 \( A=X(B)\subseteq S_X \),概率搬到数轴上算更方便:
\[ P_X(A)=P(X\in A)=P(\{s:X(s)\in A\})=\sum_{x\in A}P(X=x) \]
定义 2 · pmf 离散 r.v. \( X \) 的概率质量函数 (probability mass function, pmf):\( f(x):=P(X=x) \),满足
  1. \( f(x)\gt 0,\ \forall x\in S_X \)(且 \( x\notin S_X \) 时 \( f(x)=0 \));
  2. \( \sum_{x\in S_X}f(x)=1 \);
  3. \( P(X\in A)=\sum_{x\in A}f(x) \)。
表示方式 & 均匀 pmf 可写成公式 / 表格 / 条形图 / 概率直方图四种形式之一。若 \( f(x) \) 在 \( S_X \) 上为常数,则 \( X \) 服从均匀分布(如 \( f(x)=1/6,\,x=1\dots6 \))。

2.2 超几何分布 (Hypergeometric)

模型 总体 \( N=N_1+N_2 \) 件(\( N_1 \) 件"次品 D"、\( N_2 \) 件"良品 G"),不放回抽 \( n \) 件,\( X \) = 抽中的次品数,则 \( X\sim\text{Hyper}(N_1,N_2,n) \):
\[ f(x)=\frac{\binom{N_1}{x}\binom{N_2}{n-x}}{\binom{N}{n}} \]
取值范围:\( x\ge0,\ x\le n,\ x\le N_1,\ n-x\le N_2 \)。
\[ E(X)=n\frac{N_1}{N},\qquad \mathrm{Var}(X)=n\frac{N_1}{N}\cdot\frac{N_2}{N}\cdot\frac{N-n}{N-1} \]
均值符合直觉:样本量 × 总体次品比例。最后那项 \( \frac{N-n}{N-1} \) 叫有限总体修正(不放回带来的差异)。
例·标记重捕 80 只动物中标记 10 只放回,再抽 15 只,问含 3 只被标记的概率 → \( X\sim\text{Hyper}(N_1{=}10,N_2{=}70,n{=}15) \),\( P(X{=}3) \)。R:dhyper(x, N1, N2, n)

2.3 数学期望 E[u(X)]

定义 3 · 期望 设 \( u(X) \) 是 \( X \) 的函数(也是 r.v.),若 \( \sum_{x\in S_X}u(x)f(x) \) 存在(要求 \( \sum|u(x)|f(x)\lt\infty \)),则称之为 \( u(X) \) 的数学期望 / 期望值
\[ E[u(X)]=\sum_{x\in S_X}u(x)f(x) \]
两种算法(结果相同) 法一:直接用上式。
法二:令 \( Y=u(X) \),先求 \( Y \) 的 pmf \( g(y) \),再 \( E[Y]=\sum_y y\,g(y) \)。两者必相等。
定理 1 · 期望的线性性质
  • \( E(c)=c \)(常数);
  • \( E[c\,u(X)]=c\,E[u(X)] \);
  • \( E[c_1u_1(X)+c_2u_2(X)]=c_1E[u_1(X)]+c_2E[u_2(X)] \);
  • 一般地 \( E\big[\sum_i c_i u_i(X)\big]=\sum_i c_i E[u_i(X)] \)。
关键例·均值是最佳"代表值" 求使 \( g(b)=E[(X-b)^2] \) 最小的 \( b \):对 \( b \) 求导令零,得 \( b=E(X) \)。即
\[ E[(X-E(X))^2]\le E[(X-b)^2]\quad\forall b \]
方差正是"以均值为中心的最小平方偏差"——这解释了为什么方差围绕 \( \mu \) 定义。

2.4 均值、矩、方差、标准差

均值 µ(第一矩)
\[ \mu:=E(X)=\sum_{x}xf(x) \]
它是各取值以概率为权的加权平均。\( E(X) \) 又叫 \( X \) 的一阶矩 (first moment)
矩 (Moments) \( E(X^k) \) 称原点 \( k \) 阶矩;\( E[(X-\mu)^k] \) 称关于均值的 \( k \) 阶矩(中心矩)
方差与标准差 方差 = 二阶中心矩,度量 \( X \) 围绕均值的离散程度
\[ \sigma^2:=\mathrm{Var}(X)=E[(X-\mu)^2]=\sum_x(x-\mu)^2 f(x) \]
计算捷径(必记):
\[ \mathrm{Var}(X)=E[X^2]-\mu^2=E[X^2]-(E[X])^2 \]
标准差 \( \sigma=\sqrt{\mathrm{Var}(X)} \),与 \( X \) 同单位。
线性变换的矩 若 \( Y=aX+b \)(\( a,b \) 常数):
\[ \mu_Y=a\mu_X+b,\qquad \sigma_Y^2=a^2\sigma_X^2,\qquad \sigma_Y=|a|\,\sigma_X \]
直觉:平移 \( b \) 只挪中心、不改离散度;缩放 \( a \) 让标准差按 \( |a| \) 倍变化、方差按 \( a^2 \)。
离散均匀分布(前 m 个正整数) \( f(x)=1/m,\,x=1\dots m \):
\[ \mu=\frac{m+1}{2},\qquad \sigma^2=\frac{m^2-1}{12} \]
易混点·总体参数 vs 样本统计量 经验分布 (empirical distribution):对样本 \( x_1,\dots,x_n \) 各赋概率 \( 1/n \)。其均值正是样本均值 \( \bar x=\frac1n\sum x_i \);其方差等于 \( \frac{n-1}{n}s^2 \),其中样本方差
\[ s^2=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar x)^2 \]
注意区分:\( \mu,\sigma^2 \) 是总体参数(理论分布的);\( \bar x,s^2 \) 是样本统计量(数据算出的)。样本方差用 \( n-1 \) 而非 \( n \) 的深层原因在后续模块讲(无偏估计)。

2.5 Bernoulli 试验与二项分布 (Binomial)

二项实验的四个条件
  1. 固定次数 \( n \) 次试验(事先定好);
  2. 每次只有两个结果"成功 S / 失败 F"——这种试验叫 Bernoulli 试验
  3. 各次试验相互独立
  4. 每次成功概率 \( p \) 都相同
Bernoulli r.v. \( X_i \):成功记 1、失败记 0。pmf \( f(x_i)=p^{x_i}(1-p)^{1-x_i},\,x_i=0,1 \),且
\[ E(X_i)=p,\qquad \mathrm{Var}(X_i)=p(1-p) \]
二项分布 b(n,p) \( X \) = \( n \) 次试验的总成功数(不关心顺序)= \( X_1+\dots+X_n \),记 \( X\sim b(n,p) \):
\[ f(x)=\binom{n}{x}p^x(1-p)^{n-x},\quad x=0,1,\dots,n \]
\( \binom{n}{x} \) 是"在 \( n \) 个位置中选 \( x \) 个放成功"的方法数。
cdf 与矩 累积分布函数 (cdf):\( F(x)=P(X\le x)=\sum_{k=0}^{x}\binom nk p^k(1-p)^{n-k} \)。
\[ E(X)=np,\qquad \mathrm{Var}(X)=np(1-p) \]
\( E(X)=np \) 可由 \( X=\sum X_i \)、期望可加直接得到。R:dbinom/pbinom/rbinom(x, size, prob)
易混·二项 vs 超几何 放回抽样 → 二项(各次独立、\( p \) 不变);不放回抽样 → 超几何(各次不独立)。5% 规则:不放回时若样本量 < 总体的 5%,依赖极弱,可近似当二项处理。\( N\to\infty \) 时超几何趋于二项。

2.6 矩生成函数 (mgf)

定义 4 · mgf 若存在 \( h\gt0 \) 使 \( E(e^{tX})=\sum_x e^{tx}f(x) \) 在 \( -h\lt t\lt h \) 内有限,则
\[ M(t):=E(e^{tX}) \]
称 \( X \) 的矩生成函数 (moment-generating function)
为什么用它 直接求 \( E(X),\mathrm{Var}(X) \)(尤其二项)很费劲。mgf 把"求各阶矩"变成"求导再代入 \( t=0 \)",是统一的省力工具。
由 mgf 生成矩 对 \( M(t) \) 求 \( r \) 次导并代 \( t=0 \):
\[ M^{(r)}(0)=E(X^r),\quad\text{特别地 } \mu=M'(0),\ \ \sigma^2=M''(0)-[M'(0)]^2 \]
要这样用,\( M(t) \) 须为闭式而非展开式。
mgf 唯一确定分布 pmf 与 mgf 互相唯一决定:\( f_X=f_Y\iff M_X=M_Y \)。但 \( M_X=M_Y \) 只说"同分布",意味 \( X=Y \)。注意 mgf 可能不存在,而离散 pmf 总存在。
用 Taylor 展开找 pmf 若 mgf 不是"\( \sum a_i e^{b_i t} \)"的现成形式(如 \( M(t)=\frac{\frac12 e^t}{1-\frac12 e^t} \)),可用 Maclaurin 展开 \( (1-z)^{-1}=1+z+z^2+\cdots \) 把它摊成 \( \sum_x e^{tx}f(x) \),对照系数读出 pmf。
由所有矩反求 mgf
\[ M(t)=1+\sum_{k=1}^{\infty}E(X^k)\frac{t^k}{k!} \]
(因 \( M(0)=1,\ M^{(k)}(0)=E(X^k) \)。)例:若所有 \( E(X^k)=0.8 \),反推出 \( X\sim \) Bernoulli(0.8)。
常用 mgf Bernoulli:\( M(t)=(1-p)+pe^t \);二项:\( M(t)=(1-p+pe^t)^n \);Poisson:\( M(t)=e^{\lambda(e^t-1)} \)。

2.7 负二项分布与几何分布

负二项 NB(r,p) i.i.d. Bernoulli 试验,直到出现第 \( r \) 次成功为止,\( X \) = 所需试验次数
\[ f(x)=\binom{x-1}{r-1}p^r(1-p)^{x-r},\quad x=r,r+1,\dots \]
含义:前 \( x-1 \) 次中恰 \( r-1 \) 次成功,第 \( x \) 次成功。"负二项"得名于其 pmf 对应 \( (1-w)^{-r} \) 的 Maclaurin 展开项。
NB 的 mgf 与矩
\[ M(t)=\frac{(pe^t)^r}{[1-(1-p)e^t]^r},\quad E(X)=\frac{r}{p},\quad \mathrm{Var}(X)=\frac{r(1-p)}{p^2} \]
几何分布 Geo(p) = NB(1,p) \( X \) = 首次成功所需试验数:
\[ f(x)=p(1-p)^{x-1}=pq^{x-1},\quad x=1,2,\dots \]
\( M(t)=\dfrac{pe^t}{1-qe^t} \),\( E(X)=\dfrac1p \),\( \mathrm{Var}(X)=\dfrac{q}{p^2} \)(\( q=1-p \))。尾概率 \( P(X\gt k)=q^k \),\( P(X\le k)=1-q^k \)。
无记忆性 (Memoryless)
\[ P(X\gt m+k\mid X\gt m)=\frac{q^{m+k}}{q^m}=q^k=P(X\gt k) \]
直觉:已经失败了 \( m \) 次,对"还要再等几次"毫无影响——硬币不记得过去。几何分布是唯一具此性质的离散分布。

2.8 Poisson 分布

定义 5 · Poisson 过程 计数"连续区间内发生的事件数",参数 \( \lambda\gt0 \) 的 Poisson 过程满足:
  1. 不重叠区间内的事件数相互独立
  2. 长 \( h \) 的小区间内恰好一次的概率 \( \approx\lambda h \);
  3. 小区间内两次及以上的概率远小于 \( h \)。
典型例:单位时间来电数、保险索赔数、车祸数、二战伦敦落弹数。
由二项取极限推导 pmf 把单位区间分成 \( n \) 段(各长 \( 1/n \)),每段近似一次 Bernoulli 试验(成功率 \( \lambda/n \)),于是 \( X\approx b(n,\lambda/n) \);令 \( n\to\infty \):
\[ f(x)=P(X=x)=\frac{\lambda^x e^{-\lambda}}{x!},\quad x=0,1,2,\dots \]
记 \( X\sim\text{Poi}(\lambda) \)。验证为 pmf:\( \sum_x\frac{\lambda^x e^{-\lambda}}{x!}=e^{-\lambda}e^{\lambda}=1 \)。
mgf 与矩(均值=方差=λ)
\[ M(t)=e^{\lambda(e^t-1)},\qquad E(X)=\lambda,\qquad \mathrm{Var}(X)=\lambda \]
Poisson 的标志性特征:均值与方差都等于 \( \lambda \)。
λ 是"率",可缩放区间 \( \lambda \) = 单位区间内平均发生次数(发生率 / 强度)。长度为 \( T \) 的区间内事件数 \( Y\sim\text{Poi}(\lambda T) \),\( E(Y)=\mathrm{Var}(Y)=\lambda T \)。求概率的关键就是定对 \( \lambda \)。R:dpois/ppois/rpois(x, lambda)
用 Poisson 近似二项 若 \( X\sim b(n,p) \),\( n \) 大(如 \( n\ge100 \))、\( p \) 小(使 \( np\le10 \)),则
\[ \binom nx p^x(1-p)^{n-x}\approx\frac{(np)^x e^{-np}}{x!} \]
即用 \( \text{Poi}(np) \) 近似 \( b(n,p) \)。这与 Poisson 本身的推导一脉相承(稀有事件的大量试验)。

模块 3 · 连续分布 (Continuous distributions)

主线:从直方图取极限得到 pdf → pdf/cdf 的关系与性质 → 连续型的数字特征(求和换成积分)→ 均匀/指数/Gamma/卡方四个核心分布 → 求"随机变量函数"的分布(两种技术)。

3.1 连续随机变量:pdf 与 cdf

从直方图到 pdf 连续 r.v. 能取区间内任意值(身高、温度、等待时间…)。先画密度直方图:每个柱高 \( h(x)=\dfrac{F_n(c_i)-F_n(c_{i-1})}{c_i-c_{i-1}} \),总面积为 1。让样本量 \( n\to\infty \)、柱宽 \( \to 0 \),柱高曲线就趋向 \( F'(x)=\frac{d}{dx}P(X\le x) \)——这个极限曲线就是 pdf
定义 1 · 概率密度函数 (pdf) 连续 r.v. \( X \) 的 pdf \( f(x) \) 是可积函数,满足
\[ f(x)\ge 0,\qquad \int_{-\infty}^{+\infty}f(x)\,dx=1 \]
定义 2 · 累积分布函数 (cdf)
\[ F(x):=P(X\le x)=\int_{-\infty}^{x}f(t)\,dt \]
反过来:\( F'(x)=f(x) \)(在 \( F \) 可导处)。
连续型的关键性质(必记 & 易考)
  1. 概率 = 面积:\( P(a\lt X\le b)=\int_a^b f(t)\,dt=F(b)-F(a) \)。
  2. 单点概率为 0:\( P(X=b)=0 \)。所以 \( \le,\lt \) 在连续型里通用:\( P(a\le X\le b)=P(a\lt X\lt b) \)。
  3. pdf 不是概率(可以 \( \gt1 \));cdf 才是概率
  4. \( F(-\infty)=0,\ F(+\infty)=1 \);连续型 cdf 连续且非减(离散型 cdf 是阶梯函数,在取值点跳跃,跳高 = 该点概率)。
  5. \( F \) 不一定处处可导;改 pdf 在有限/可数个点的值不改变 cdf。
经验分布函数 (ecdf) 样本 \( x_1,\dots,x_n \) 的 ecdf:\( F_n(x)=\dfrac{\#\{x_i\le x\}}{n} \)。\( n \) 大时 \( F_n(x) \) 可用来估计真实 cdf \( F(x) \)。

3.2 连续型的数字特征

把求和换成积分 定义与离散型完全一致,只把 \( \sum \) 换成 \( \int \):
\[ \mu=E(X)=\int_{-\infty}^{\infty}xf(x)\,dx,\qquad \sigma^2=\int_{-\infty}^{\infty}(x-\mu)^2 f(x)\,dx=E(X^2)-\mu^2 \]
\( k \) 阶矩 \( E(X^k)=\int x^k f(x)\,dx \);mgf \( M(t)=E(e^{tX})=\int e^{tx}f(x)\,dx \)。
mgf 结论照旧 \( \mu=M'(0),\ \sigma^2=M''(0)-[M'(0)]^2,\ E(X^k)=M^{(k)}(0) \),与离散情形相同。
百分位数 / 分位数 \( (100p) \) 分位数 \( \pi_p \) 满足 \( p=\int_{-\infty}^{\pi_p}f(x)\,dx=F(\pi_p) \)。
  • 中位数 (median) \( m=\pi_{0.5} \);
  • 下/上四分位数 \( q_1=\pi_{0.25},\ q_3=\pi_{0.75} \)。
注意区分"分布的分位数"与"样本的分位数"。

3.3 均匀分布 U(a,b)

定义 在 \( [a,b] \) 上等可能取点,\( X\sim U(a,b) \):
\[ f(x)=\frac{1}{b-a},\ a\le x\le b;\qquad F(x)=\frac{x-a}{b-a},\ a\le x\lt b \]
矩与 mgf
\[ E(X)=\frac{a+b}{2},\quad \mathrm{Var}(X)=\frac{(b-a)^2}{12},\quad M(t)=\frac{e^{tb}-e^{ta}}{t(b-a)}\ (t\neq0) \]
标准均匀 U(0,1) \( a=0,b=1 \) 的 \( U(0,1) \) 是计算机生成随机数的基石——其他分布的随机数都先从 \( U(0,1) \) 生成(见 3.7 逆变换法)。

3.4 指数分布 Exp(θ)

来自 Poisson 过程的"首次等待时间" Poisson 过程(率 \( \lambda \))中,\( W \) = 等到第一次事件的时间。因 \( [0,w] \) 内事件数 \( \sim\text{Poi}(\lambda w) \):
\[ F(w)=1-P(\text{无事件})=1-e^{-\lambda w},\quad f(w)=\lambda e^{-\lambda w} \]
记 \( \theta=1/\lambda \)(均值),\( X\sim\text{Exp}(\theta) \):\( f(x)=\frac1\theta e^{-x/\theta},\ x\ge0 \)。
矩与 mgf
\[ E(X)=\theta,\qquad \mathrm{Var}(X)=\theta^2,\qquad M(t)=\frac{1}{1-\theta t}\ \left(t\lt\tfrac1\theta\right) \]
无记忆性 (Memoryless)
\[ P(X\gt x+y\mid X\gt x)=\frac{e^{-(x+y)/\theta}}{e^{-x/\theta}}=e^{-y/\theta}=P(X\gt y) \]
已用 \( x \) 小时不影响"还能再用 \( y \) 小时"的概率。指数分布是唯一具无记忆性的连续分布——它是几何分布的连续对应。
例·换算 λ 与 θ 顾客按 Poisson 到店、每小时平均 20 人 → \( \lambda=20/60=1/3 \) 人/分,\( \theta=1/\lambda=3 \) 分。等首位顾客超 5 分钟:\( P(X\gt5)=e^{-5/3} \)。

3.5 Gamma 分布与 Gamma 函数

来自 Poisson 过程的"第 α 次等待时间" \( W \) = 等到第 \( \alpha \) 次事件的时间。由"少于 \( \alpha \) 次"= Poisson 尾和求导得 pdf:
\[ f(x)=\frac{1}{\Gamma(\alpha)\theta^\alpha}x^{\alpha-1}e^{-x/\theta},\quad 0\le x\lt\infty \]
\( \alpha\gt0 \) 是形状参数 (shape),\( \theta\gt0 \) 是尺度参数 (scale)(\( \theta=1/\lambda \))。\( \alpha \) 不必是整数。
Gamma 函数 Γ(t)
\[ \Gamma(t)=\int_0^\infty y^{t-1}e^{-y}\,dy,\quad t\gt0 \]
关键性质:\( \Gamma(1)=1 \);\( \Gamma(t)=(t-1)\Gamma(t-1) \)(分部积分);故整数 \( \Gamma(n)=(n-1)! \)("广义阶乘");\( \Gamma(\tfrac12)=\sqrt\pi \)。
矩、mgf、与指数的关系
\[ M(t)=\frac{1}{(1-\theta t)^\alpha}\ \left(t\lt\tfrac1\theta\right),\quad E(X)=\alpha\theta,\quad \mathrm{Var}(X)=\alpha\theta^2 \]
若 \( \alpha \) 为正整数,则 \( X=X_1+\cdots+X_\alpha \),其中 \( X_i \) 是独立的 \( \text{Exp}(\theta) \)。整数 \( \alpha \) 时还可用 Poisson 关系算 cdf:\( F(x)=1-\sum_{k=0}^{\alpha-1}\frac{(x/\theta)^k e^{-x/\theta}}{k!} \)。
两套"优雅对应"(课件重点) 离散:i.i.d. Bernoulli 试验 → 二项 / 几何 / 负二项
连续:Poisson 过程 → Poisson / 指数 / Gamma
对应关系:几何 ↔ 指数(首次成功/事件),负二项 ↔ Gamma(第 \( r \)/α 次)。Gamma 是指数的推广,是负二项的连续对应。应用:等到第 \( k \) 次到达、\( k \) 场降雨总量、\( k \) 笔索赔总额等。

3.6 卡方分布 χ²(r)

作为特殊的 Gamma 取 \( \theta=2,\ \alpha=r/2 \)(\( r \) 正整数)的 Gamma 就是自由度 (degrees of freedom) 为 \( r \) 的卡方分布 \( \chi^2(r) \):
\[ f(x)=\frac{1}{\Gamma(r/2)2^{r/2}}x^{r/2-1}e^{-x/2},\quad x\ge0 \]
矩与 mgf
\[ E(X)=\alpha\theta=r,\quad \mathrm{Var}(X)=\alpha\theta^2=2r,\quad M(t)=(1-2t)^{-r/2}\ (t\lt\tfrac12) \]
卡方是统计应用中最重要的分布之一(已有专门概率表)。概率计算同 Gamma。

3.7 随机变量函数的分布

已知 \( X \) 的分布,求 \( Y=u(X) \) 的分布。课件教两种技术,怎么选是常考点

方法一 · 分布函数法 (distribution function technique) 通用三步:① 定 \( Y \) 的支撑;② 直接求 cdf \( G(y)=P(Y\le y)=P(u(X)\le y) \),把它翻译成关于 \( X \) 的概率再用 \( F_X \) 算;③ 求导得 pdf \( g(y)=G'(y) \)。
方法二 · 换元法 (change-of-variable technique) 仅适用于 \( Y=u(X) \) 单调(一一对应)。设逆函数 \( X=v(Y) \),则
\[ g(y)=f\big[v(y)\big]\cdot\big|v'(y)\big|,\quad y\in S_Y \]
增函数时 \( v'\gt0 \),减函数时取 \( -v' \),统一写成绝对值 \( |v'(y)| \)(这个绝对值的 Jacobian 因子是关键)。
★ 怎么选(你最容易混的地方)
  • 单调一一对应 → 两种都行,换元法更快(直接套 Jacobian 公式)。
  • 非一一对应(如 \( Y=X^2 \) 在含 0 的区间上)→ 换元法失效必须用分布函数法:分段讨论 \( G(y)=P(X^2\le y) \) 再求导。
  • 离散 r.v. → 换元法公式不适用(没有连续 Jacobian),直接用 pmf 关系 \( g(y)=P(u(X)=y) \)。
例·非一一对应必须分段 \( Y=X^2 \),\( X \) 的支撑跨过 0 时,\( y \) 的某些区间对应 \( X \) 的两段(正负),cdf 要把两段都算进去再求导,得到的 pdf 在不同 \( y \) 区间形式不同。Cauchy 分布 \( f(x)=\frac{1}{\pi(1+x^2)} \) 即由"指针角度 \( X=\tan W \)"用分布函数法导出,且其 \( E(X) \) 不存在
定理 1&2 · 逆变换抽样 (Inverse transform) 设 \( F \) 是连续严格增 cdf:
  • 定理 1:\( Y\sim U(0,1) \) ⇒ \( X=F^{-1}(Y) \) 的 cdf 就是 \( F \)。
  • 定理 2(逆命题):\( Y=F(X)\sim U(0,1) \)。
用途:模拟任意分布 要生成服从 \( F \) 的随机数:先生成 \( U(0,1) \) 的 \( y \),再算 \( x=F^{-1}(y) \)。例:\( \text{Exp}(\theta=10) \) 的 \( F^{-1}(y)=-10\ln(1-y) \),所以"取 \( y\sim U(0,1) \),令 \( x=-10\ln(1-y) \)"即得指数随机数。这正是 \( U(0,1) \) 是模拟基石的原因。

模块 4 · 多元分布 (Multivariate distributions)

主线:把单变量推广到多变量 → 联合/边际/条件分布 → 协方差与相关系数(度量关联)→ 多元变换(Jacobian)→ 多个独立变量及其和 → 用 Chebyshev 不等式证明大数定律。这是通往 CLT 的桥梁。

4.1 两个随机变量的联合分布

联合 pmf / pdf / cdf 离散:联合 pmf \( f(x,y)=P(X=x,Y=y) \),满足 \( 0\le f\le1,\ \sum\sum f=1 \)。
连续:联合 pdf \( f(x,y)\ge0,\ \iint f\,dx\,dy=1 \),且 \( f(x,y)=\dfrac{\partial^2 F}{\partial x\,\partial y} \)。
联合 cdf:\( F(x,y)=P(X\le x,Y\le y) \)。
定义 3 · 边际分布 (Marginal)另一个变量"加掉/积掉",得到单个变量自己的分布:
\[ f_1(x)=\sum_y f(x,y)\ \ (\text{离散}),\qquad f_1(x)=\int_{-\infty}^{\infty}f(x,y)\,dy\ \ (\text{连续}) \]
(表格里:行求和 = \( X \) 的边际,列求和 = \( Y \) 的边际。)
独立性判定 \( X,Y \) 独立 \( \iff f(x,y)\equiv f_1(x)f_2(y)\iff F(x,y)\equiv F_1(x)F_2(y) \)。
★ 看支撑就能初判独立 若联合支撑 \( S \) 不是矩形(\( X \) 的可取值依赖于 \( Y \) 取值,如 \( 0\le x\le y\le1 \)),则 \( X,Y \) 一定不独立。这是个快速判据:非矩形支撑 ⇒ 依赖。
多元期望(两种算法) \( E[u(X,Y)]=\sum\sum u(x,y)f(x,y) \)(或积分)。求单变量的矩时,用联合分布或边际分布都行:\( \mu_i=E(X_i)=\sum x_i f(x_1,x_2)=\sum x_i f_i(x_i) \)。
三项分布 (Trinomial) 二项的推广:每次试验三种结果(概率 \( p_1,p_2,p_3=1-p_1-p_2 \)),\( n \) 次独立试验中 \( X_1,X_2 \) 计两类的次数:
\[ f(x_1,x_2)=\frac{n!}{x_1!\,x_2!\,(n-x_1-x_2)!}p_1^{x_1}p_2^{x_2}p_3^{n-x_1-x_2} \]
边际仍是二项:\( X_1\sim b(n,p_1),\ X_2\sim b(n,p_2) \)。

4.2 协方差与相关系数

协方差 (Covariance)
\[ \mathrm{Cov}(X_1,X_2)=\sigma_{12}=E[(X_1-\mu_1)(X_2-\mu_2)]=E(X_1X_2)-\mu_1\mu_2 \]
后一式是常用计算捷径。
相关系数 (Correlation coefficient)
\[ \rho=\frac{\mathrm{Cov}(X_1,X_2)}{\sigma_1\sigma_2} \]
\( \rho\gt0 \):大值常配大值(正关联);\( \rho\lt0 \):大值常配小值(负关联)。
定理 1 · 协方差/方差性质
  • \( E[a u_1+b u_2+c]=aE[u_1]+bE[u_2]+c \);
  • \( \mathrm{Cov}(X,a)=0 \);\( \mathrm{Cov}(aX,bY)=ab\,\mathrm{Cov}(X,Y) \);
  • \( \mathrm{Cov}(X+a,Y+b)=\mathrm{Cov}(X,Y) \)(平移不变);
  • \( \mathrm{Cov}(X,aX+b)=a\,\mathrm{Var}(X) \);
  • (必记) \( \mathrm{Var}(aX+bY)=a^2\mathrm{Var}(X)+2ab\,\mathrm{Cov}(X,Y)+b^2\mathrm{Var}(Y) \)。
★ 独立 ⇒ 不相关,但反之不成立 \( X,Y \) 独立 ⇒ \( E[u(X)v(Y)]=E[u(X)]E[v(Y)] \) ⇒ \( \mathrm{Cov}=0 \)(不相关 uncorrelated)。
不相关 ⇏ 独立:反例 \( f(x,y)=\frac13 \) 于 \( (0,1),(1,0),(2,1) \),支撑非矩形故不独立,却算得 \( \mathrm{Cov}=0 \)。原因:\( \rho \) 只测线性关联,测不到非线性依赖。
|ρ| ≤ 1,ρ 测线性关系 考察 \( g(a,b)=E[(Y-aX-b)^2] \)(用直线 \( aX+b \) 逼近 \( Y \) 的最小平方误差),求最小得最优斜率 \( \hat a=\rho\frac{\sigma_Y}{\sigma_X} \),且最小值 \( =\sigma_Y^2(1-\rho^2)\ge0 \),于是 \( |\rho|\le1 \)。
\[ \rho=\pm1\iff \text{所有 }(X,Y)\text{ 点落在一条直线上} \]
对应的直线 \( Y=\rho\frac{\sigma_Y}{\sigma_X}(X-\mu_X)+\mu_Y \) 叫最小二乘线 (least squares line)

4.3 条件分布与条件期望

定义 4 · 条件 pmf/pdf
\[ g(x\mid y)=\frac{f(x,y)}{f_2(y)},\qquad h(y\mid x)=\frac{f(x,y)}{f_1(x)} \]
(连续型同样,分母为边际 pdf。)固定竖线右边的"已知"变量后,它是左边变量的一个合法 pmf/pdf。
★ 记住方向 竖线 右边是"已知/给定",左边是"想求"。\( g(x\mid y) \) = 已知 \( Y=y \) 时 \( X \) 的分布,把它看成 \( x \) 的函数(\( y \) 当常数)。
条件期望 / 条件方差
\[ \mu_{X\mid y}=E(X\mid y)=\sum_x x\,g(x\mid y),\qquad \sigma^2_{X\mid y}=E(X^2\mid y)-\mu_{X\mid y}^2 \]
\( E(X\mid Y=y) \) 是只关于 \( y \) 的函数。若 \( X,Y \) 独立,则条件分布 = 边际分布,\( E(X\mid y)=E(X) \)。
例·三项分布的条件是二项 若 \( (X,Y)\sim\text{trinomial}(n,p_1,p_2) \),则 \( \{X\mid Y=y\}\sim b\!\left(n-y,\frac{p_1}{1-p_2}\right) \)——已知一类的数目后,剩下名额在另两类间重新二项分配。

4.4 条件期望的塔性质与方差分解

两条核心性质
\[ E(X)=E\big[E(X\mid Y)\big] \]
\[ \mathrm{Var}(X)=\mathrm{Var}\big[E(X\mid Y)\big]+E\big[\mathrm{Var}(X\mid Y)\big] \]
读法:"均值 = 条件均值的均值";"方差 = 条件均值的方差 + 条件方差的均值"
例·两步随机(保险索赔) 一年索赔总数 \( N\sim\text{Poi}(\lambda=1000) \),给定 \( N \) 后非寿险数 \( X\mid N\sim b(N,0.8) \)。用塔性质免去求边际
\[ E(X)=E[E(X\mid N)]=E[0.8N]=800 \]
\( \mathrm{Var}(X)=\mathrm{Var}[0.8N]+E[0.16N]=0.64\lambda+0.16\lambda=800 \)。直接求边际会发现 \( X\sim\text{Poi}(\lambda p)=\text{Poi}(800) \),结果一致但绕远路。

4.5 多元变换与 Jacobian

二维换元法 设 \( (X_1,X_2)\to(Y_1,Y_2) \) 是一一对应可微变换。步骤:
  1. 求逆变换 \( x_1=v_1(y_1,y_2),\ x_2=v_2(y_1,y_2) \);
  2. Jacobian 行列式
    \[ J=\begin{vmatrix}\dfrac{\partial x_1}{\partial y_1}&\dfrac{\partial x_1}{\partial y_2}\\[6pt]\dfrac{\partial x_2}{\partial y_1}&\dfrac{\partial x_2}{\partial y_2}\end{vmatrix} \]
    (\( J \) 是一维 \( v'(y) \) 的推广,\( |J| \) 表示变换的"面积缩放因子");
  3. 把 \( S \) 的边界映射,求出 \( (Y_1,Y_2) \) 的支撑 \( S_1 \)(通常最难);
  4. 联合 pdf:\( g(y_1,y_2)=|J|\cdot f(v_1,v_2) \)。
由此导出的两个新分布
  • Beta 分布:\( X_1,X_2 \) 独立 Gamma,则 \( Y_1=\frac{X_1}{X_1+X_2}\sim\text{Beta}(\alpha,\beta) \),pdf \( \frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}y^{\alpha-1}(1-y)^{\beta-1} \);\( \alpha=\beta=1 \) 时退化为 \( U(0,1) \)。同时 \( Y_2=X_1+X_2 \) 仍是 Gamma\( (\theta,\alpha+\beta) \)。
  • F 分布:\( U\sim\chi^2(r_1),\ V\sim\chi^2(r_2) \) 独立,则 \( W=\frac{U/r_1}{V/r_2}\sim F(r_1,r_2) \)。

4.6 多个独立随机变量

随机样本 (random sample) 独立重复同一实验 \( n \) 次得 \( X_1,\dots,X_n \),称容量为 \( n \) 的随机样本。独立时联合 = 边际之积:
\[ f(x_1,\dots,x_n)=\prod_{i=1}^{n}f_i(x_i) \]
定理 3 · 独立 ⇒ 乘积期望可拆 若 \( X_1,\dots,X_n \) 独立:
\[ E[u_1(X_1)\cdots u_n(X_n)]=E[u_1(X_1)]\cdots E[u_n(X_n)] \]
注意:这意味 \( E[X^2]=(E[X])^2 \)(同一个 \( X \) 不独立于自己)。
例·min/max 用补事件 求 \( P[\min(X_1,X_2,X_3)\le3] \) 直接积分很烦,改用 \( 1-P[\text{全部}\gt3]=1-\prod P(X_i\gt3) \)。处理 \( \min/\max \) 的标准技巧。

4.7 独立变量和的分布

统计量与抽样分布 样本的函数叫统计量 (statistic),如样本均值 \( \bar X \)、样本方差 \( S^2 \)、次序统计量。统计量本身是随机变量,其分布叫抽样分布 (sampling distribution)
定理 4 · 线性组合的均值与方差 \( X_i \) 独立、均值 \( \mu_i \)、方差 \( \sigma_i^2 \),\( Y=\sum a_i X_i \):
\[ \mu_Y=\sum a_i\mu_i,\qquad \sigma_Y^2=\sum a_i^2\sigma_i^2 \]
(方差里没有交叉项,正因独立时 \( \mathrm{Cov}=0 \)。)
★ 样本均值的均值与方差(极重要) \( X_1,\dots,X_n \) 来自均值 \( \mu \)、方差 \( \sigma^2 \) 的分布,\( \bar X=\frac1n\sum X_i \):
\[ E(\bar X)=\mu,\qquad \mathrm{Var}(\bar X)=\frac{\sigma^2}{n} \]
含义:\( \bar X \) 平均下来等于 \( \mu \)(可用来估计 \( \mu \)),且样本越大、方差越小、估计越准
定理 5 · mgf 法求和的分布 \( X_i \) 独立,\( Y=\sum a_i X_i \):\( M_Y(t)=\prod M_{X_i}(a_it) \)。
i.i.d. 时:\( M_{\sum X_i}(t)=[M(t)]^n \),\( M_{\bar X}(t)=[M(t/n)]^n \)。
三个经典"和的分布"(mgf 一招搞定)
  • \( n \) 个 i.i.d. Bernoulli\( (p) \) 之和 \( \sim b(n,p) \);
  • \( n \) 个 i.i.d. \( \text{Exp}(\theta) \) 之和 \( \sim \) Gamma\( (\theta,n) \)(\( \bar X\sim \)Gamma\( (\theta/n,n) \));
  • 定理 6:独立卡方之和仍卡方,\( \sum\chi^2(r_i)\sim\chi^2(\sum r_i) \)。
做法:把各自 mgf 相乘,认出结果是哪个分布的 mgf(靠 mgf 唯一性)。

4.8 Chebyshev 不等式与依概率收敛

定理 7 · Chebyshev 不等式 任意有均值 \( \mu \)、方差 \( \sigma^2 \) 的 \( X \),对每个 \( k\ge1 \):
\[ P(|X-\mu|\ge k\sigma)\le\frac{1}{k^2} \]
变体(Corollary 2):令 \( \varepsilon=k\sigma \),\( P(|X-\mu|\ge\varepsilon)\le\dfrac{\sigma^2}{\varepsilon^2} \)。
含义 对任何分布都成立的粗略界:偏离均值超过 2 个标准差的概率 \( \le25\% \),超过 3 个 \( \le11\% \)。代价是"粗"——它不需要知道分布形状,所以给的界比较松。证明用了 \( \left(\frac{x-\mu}{k\sigma}\right)^2\ge1 \) 在尾部放大被积函数。
依概率收敛 & 大数定律 (LLN) 对样本均值用 Chebyshev:\( P(|\bar X-\mu|\ge\varepsilon)\le\frac{\sigma^2}{n\varepsilon^2}\to0 \)。所以
\[ \lim_{n\to\infty}P(|\bar X-\mu|\lt\varepsilon)=1\quad\forall\varepsilon\gt0 \]
称 \( \bar X \) 依概率收敛 (converges in probability) 到 \( \mu \),这就是大数定律。同理样本比例 \( \hat p=Y/n \) 依概率收敛到 \( p \)(因 \( E[Y/n]=p,\ \mathrm{Var}[Y/n]=pq/n\to0 \))——这正是模块 1"长期相对频率"解释的严格依据。

模块 5 · 正态分布与中心极限定理

主线:正态分布及其标准化 → 正态衍生的卡方/t/F → 正态样本的 \( \bar X \) 与 \( S^2 \) 分布 → 中心极限定理(任意分布的均值都趋于正态)→ 离散分布的正态近似 → 极限 mgf → 二元正态。这是连接概率与统计推断的枢纽。

5.1 正态分布与标准化

从哪来 反复观察"样本均值 \( \bar X_n \) 的分布":无论原始分布是均匀还是指数,当 \( n \) 变大,\( \bar X_n \) 的 pdf 都越来越像同一种钟形曲线。de Moivre / Laplace / Gauss 发现它就是正态 pdf
正态分布 N(µ,σ²)
\[ f(x)=\frac{1}{\sigma\sqrt{2\pi}}\exp\!\left[-\frac{(x-\mu)^2}{2\sigma^2}\right],\quad -\infty\lt x\lt\infty \]
\[ E(X)=\mu,\quad \mathrm{Var}(X)=\sigma^2,\quad M(t)=e^{\mu t+\frac12\sigma^2 t^2} \]
标准正态 N(0,1) \( Z\sim N(0,1) \),pdf \( \varphi(z)=\frac{1}{\sqrt{2\pi}}e^{-z^2/2} \),cdf \( \Phi(z)=P(Z\le z) \)(无初等表达式,需查表/数值)。mgf \( M(t)=e^{t^2/2} \),\( E(Z)=0,\mathrm{Var}(Z)=1 \)。
定理 1 · 标准化 (Standardisation)
\[ X\sim N(\mu,\sigma^2)\iff Z=\frac{X-\mu}{\sigma}\sim N(0,1) \]
所以任意正态概率都能化成查标准正态表:
\[ P(a\le X\le b)=\Phi\!\left(\frac{b-\mu}{\sigma}\right)-\Phi\!\left(\frac{a-\mu}{\sigma}\right) \]
证明用 mgf 法:算 \( Z \) 的 mgf 恰好等于 \( e^{t^2/2} \),再由 mgf 唯一性下结论。

5.2 正态与卡方的关系

定理 2 · 标准正态的平方是卡方
\[ Z\sim N(0,1)\ \Rightarrow\ Z^2\sim\chi^2(1) \]
(用分布函数法证:\( P(Z^2\le v)=P(-\sqrt v\le Z\le\sqrt v) \) 求导,借 \( \Gamma(\tfrac12)=\sqrt\pi \) 凑出 \( \chi^2(1) \) 的 pdf。)推论:\( X\sim N(\mu,\sigma^2)\Rightarrow\frac{(X-\mu)^2}{\sigma^2}\sim\chi^2(1) \)。
定理 4 · 标准正态平方和是卡方 \( Z_1,\dots,Z_n \) 独立 \( N(0,1) \),则 \( W=\sum Z_i^2\sim\chi^2(n) \)。(由定理 2 + 模块 4 的卡方可加性。)这正是卡方分布"自由度"的来源——\( n \) 个独立标准正态平方之和的自由度就是 \( n \)。

5.3 正态样本的 X̄ 与 S² 分布

定理 3 · 样本均值仍正态 i.i.d. 来自 \( N(\mu,\sigma^2) \):
\[ \bar X\sim N\!\left(\mu,\ \frac{\sigma^2}{n}\right) \]
(mgf 法直接得;\( n \) 越大,\( \bar X \) 越集中在 \( \mu \)。)
定理 5 · 样本方差与卡方 正态样本下:
  1. \( \bar X \) 与 \( S^2 \) 相互独立(正态分布的特殊性质,需高级工具证明);
  2. \( \dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1) \)。
★ 为什么是 n−1 自由度 对比两个量:用真均值 \( \mu \) 时 \( \sum\frac{(X_i-\mu)^2}{\sigma^2}\sim\chi^2(n) \)(\( n \) 个自由度);用样本均值 \( \bar X \) 替代 \( \mu \) 时 \( \sum\frac{(X_i-\bar X)^2}{\sigma^2}\sim\chi^2(n-1) \)。证明的核心恒等式:
\[ \underbrace{\sum\Big(\tfrac{X_i-\mu}{\sigma}\Big)^2}_{\chi^2(n)}=\underbrace{\tfrac{(n-1)S^2}{\sigma^2}}_{\chi^2(n-1)}+\underbrace{\tfrac{n(\bar X-\mu)^2}{\sigma^2}}_{\chi^2(1)} \]
"估计了一个参数 \( \mu \)(用 \( \bar X \))就损失一个自由度"——这就是 \( S^2 \) 分母用 \( n-1 \) 的根本原因。

5.4 t 分布(含动机)

★ 为什么需要 t 分布 标准化 \( \frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1) \) 要求知道 \( \sigma \)。但现实中 \( \sigma \) 往往未知,只能用样本标准差 \( S \) 代替。代替之后,分母多了随机性,结果不再是正态,而是更"胖尾"的 t 分布。
t 分布的定义
\[ T=\frac{Z}{\sqrt{U/r}},\quad Z\sim N(0,1),\ U\sim\chi^2(r),\ Z\perp U\ \Rightarrow\ T\sim t(r) \]
pdf 对称于 0,\( E(T)=0,\ \mathrm{Var}(T)=\frac{r}{r-2} \)。由 Gosset(笔名"Student",在 Guinness 酒厂工作)1907 年导出。
T 统计量的分布 把分子的 \( N(0,1) \)(来自 \( \bar X \))与分母的 \( \chi^2(n-1) \)(来自 \( S^2 \))按定义组合:
\[ T=\frac{\bar X-\mu}{\sqrt{S^2/n}}\sim t(n-1) \]
这是单样本区间估计与假设检验的基础统计量。
极限:t → 正态 \( r\to\infty \) 时 t 分布趋于 \( N(0,1) \)。直觉:样本大了,\( S \) 估 \( \sigma \) 越准,分母随机性消失,t 退回正态。

5.5 中心极限定理 (CLT)

定理 7 · CLT \( X_1,\dots,X_n \) 来自任意有限均值 \( \mu \)、有限正方差 \( \sigma^2 \) 的分布,则
\[ W=\frac{\bar X_n-\mu}{\sigma/\sqrt n}=\frac{\sum X_i-n\mu}{\sqrt n\,\sigma}\ \xrightarrow{\ n\to\infty\ }\ N(0,1) \]
★ 为什么重要 不管原始分布长什么样,只要 \( n \) 够大:\( \bar X_n\approx N(\mu,\sigma^2/n) \),\( \sum X_i\approx N(n\mu,n\sigma^2) \)。这让我们能对未知分布的均值做概率计算。经验法则:\( n\gt25 \) 或 \( 30 \) 通常够;若原分布对称光滑,\( n=4\sim5 \) 就够。
证明骨架(mgf + Taylor) 令 \( Y_i=\frac{X_i-\mu}{\sigma} \)(均值 0、方差 1),\( W=\frac{1}{\sqrt n}\sum Y_i \)。其 mgf \( M_W(t)=[m(t/\sqrt n)]^n \)。对 \( m \) 做 Taylor 展开(用 \( m(0)=1,m'(0)=0,m''(0)=1 \)):\( m(t/\sqrt n)\approx1+\frac{t^2}{2n} \),于是 \( [1+\frac{t^2}{2n}]^n\to e^{t^2/2} \),正是 \( N(0,1) \) 的 mgf。

5.6 离散分布的正态近似与连续性校正

为什么能近似 二项、Poisson、负二项都能写成 i.i.d. 变量之和(二项=Bernoulli和,负二项=几何和,Poisson 可拆成小 Poisson 和),所以 CLT 适用,可用正态近似:
\[ b(n,p)\approx N(np,\,np(1-p)),\quad \text{Poi}(\lambda)\approx N(\lambda,\lambda),\quad NB(r,p)\approx N\!\Big(\tfrac rp,\tfrac{rq}{p^2}\Big) \]
★ 连续性校正 (Continuity correction) 离散变量取整数点,正态是连续曲线。把"\( X=k \)"看成正态曲线下底边 \( [k-\tfrac12,\,k+\tfrac12] \) 的面积——这 \( \pm\tfrac12 \) 就是连续性校正。规则:
\[ P(X=k)\approx P\big(k-\tfrac12\le X\le k+\tfrac12\big) \]
\[ P(a\lt X\le b)\approx P\big(a+\tfrac12\le X\le b+\tfrac12\big),\quad P(a\le X\lt b)\approx P\big(a-\tfrac12\le X\le b-\tfrac12\big) \]
直觉:每个整数 \( k \) 在直方图里占一根宽度为 1 的柱(底边 \( k\pm\tfrac12 \)),用正态面积近似这根柱时必须把半个单位的边界算进去,否则会系统性漏掉/多算边界半格。
适用条件 二项正态近似通常要求 \( np\ge5 \) 且 \( n(1-p)\ge5 \)。Poisson、负二项的近似也照用同样的连续性校正规则。

5.7 极限 mgf 与退化分布

定理 8 · 极限 mgf 若一列 mgf 趋于某个 mgf \( M(t) \),则对应的分布也趋于 \( M(t) \) 对应的分布。(CLT 的证明就是这招。)缺点:有些分布 mgf 不存在,此时改用特征函数 \( \phi(t)=E(e^{itX}) \)。
例·Poisson 近似二项(极限版) \( X\sim b(n,p) \),令 \( n\to\infty \) 而 \( np=\lambda \) 保持常数(故 \( p\to0 \)):\( M_X(t)=(1-p+pe^t)^n=\big(1+\frac{\lambda(e^t-1)}{n}\big)^n\to e^{\lambda(e^t-1)} \),即 \( \text{Poi}(\lambda) \) 的 mgf。区别:Poisson 近似取 \( np \) 常数(\( p \) 很小时更准);正态近似取 \( p \) 常数(\( n \) 大时)。
★ 退化分布的 mgf 论证 i.i.d. \( \text{Exp}(\theta) \) 的 \( \bar X \):\( M_{\bar X}(t)=[(1-\theta t/n)^{-1}]^n=(1-\theta t/n)^{-n}\to e^{\theta t} \)。而 \( e^{\theta t} \) 是退化分布 (degenerate) 的 mgf——这个"随机变量"只能取单一值 \( \theta \)。所以 \( \bar X \) 依概率收敛到常数 \( \theta \)。这是用 mgf 重新证明大数定律的漂亮例子:极限 mgf 是 \( e^{(\text{常数})t} \) 就意味着"塌缩成一个点"。

5.8 二元正态分布 (Bivariate normal)

关键警告 即使已知 \( X\sim N(\mu_X,\sigma_X^2) \) 和 \( Y\sim N(\mu_Y,\sigma_Y^2) \),也无法唯一确定它们的联合分布——边际不决定联合。要锁定联合分布,需额外假设(条件分布也正态、条件均值线性、条件方差恒定、相关系数 \( \rho \))。
二元正态 BN(µX,µY,σX²,σY²,ρ) 联合 pdf:
\[ f(x,y)=\frac{1}{2\pi\sigma_X\sigma_Y\sqrt{1-\rho^2}}\exp\!\left\{-\frac{1}{2(1-\rho^2)}\left[\Big(\tfrac{x-\mu_X}{\sigma_X}\Big)^2-2\rho\,\tfrac{x-\mu_X}{\sigma_X}\tfrac{y-\mu_Y}{\sigma_Y}+\Big(\tfrac{y-\mu_Y}{\sigma_Y}\Big)^2\right]\right\} \]
五条性质
  1. 边际 \( X\sim N(\mu_X,\sigma_X^2) \),\( Y\sim N(\mu_Y,\sigma_Y^2) \);
  2. 相关系数为 \( \rho \);
  3. 条件分布也正态:\( (Y\mid X=x)\sim N\!\big(\mu_Y+\rho\tfrac{\sigma_Y}{\sigma_X}(x-\mu_X),\ \sigma_Y^2(1-\rho^2)\big) \)(条件均值线性、条件方差变小)。
定理 9 · 正态下"不相关 ⟺ 独立" 一般情况下"不相关 ⇏ 独立"(见模块 4 反例)。但对二元正态
\[ \rho=0\iff X,Y\text{ 独立} \]
因为 \( \rho=0 \) 时联合 pdf 恰好分解成 \( f_1(x)f_2(y) \)。这是正态分布的一个特别优良的性质。

模块 6 · 随机过程与 Markov 链

主线:随机过程的概念 → Markov 链与"无记忆"的马尔可夫性质 → 转移矩阵 → m 步转移 = 矩阵的 m 次方 → 平衡(平稳)分布。把前面的条件概率/矩阵工具用到"随时间演化的随机系统"上。

6.1 随机过程

随机过程 (Stochastic process) 一组随时间编号的随机变量 \( \{X_t,\,t\in T\} \)。例:第 \( t \) 天到医院的病人数、时刻 \( t \) 的股指、第 \( t \) 月降雨量。
  • 每个 \( X_t \) 取值于状态空间 (state space) \( S \);
  • \( T \) 叫指标集 (index set)
本课只考虑 \( S \) 与 \( T \) 都离散的情形,可把状态编号为 \( S=\{1,2,\dots,N\} \),时间编号为 \( T=\{0,1,2,\dots\} \)。

6.2 Markov 链与马尔可夫性质

定义 1 · Markov 链 离散时间离散状态随机过程 \( \{X_n\}_{n=0}^{\infty} \) 是 Markov 链,若
\[ P(X_{n+1}=j_{n+1}\mid X_0=j_0,\dots,X_n=j_n)=P(X_{n+1}=j_{n+1}\mid X_n=j_n) \]
★ 马尔可夫性质 = "无记忆" 未来 \( X_{n+1} \) 的条件概率只依赖于当前 \( X_n \),与更早的历史无关。形象地说:要预测下一步,只需知道"现在在哪",不必知道"怎么走到现在的"。
齐次 (Homogeneous) 若 \( P(X_{n+m}=j\mid X_n=i)=P(X_m=j\mid X_0=i) \) 对所有起始时间 \( n \) 都成立,即转移概率不随起始时间变化,称链齐次 / 时齐。本课只研究齐次链。

6.3 转移概率与转移矩阵

一步转移概率与转移矩阵
\[ P_{ij}=P(X_{n+1}=j\mid X_n=i) \]
排成一步转移矩阵 (transition matrix) \( P=[P_{ij}]_{|S|\times|S|} \)。
★ 关键性质:每行之和 = 1 \( P \) 的每一行加起来等于 1(从状态 \( i \) 出发,下一步必然落到某个状态)。这是检查转移矩阵是否合法的快速方法。
m 步转移
\[ P^{(m)}_{ij}=P(X_{n+m}=j\mid X_n=i) \]
排成 m 步转移矩阵 \( P^{(m)} \)。通常题目给 \( P \),首要任务是求 \( P^{(m)} \)。

6.4 m 步转移 = 矩阵的 m 次方

定理 1
\[ P^{(m)}=P^m \]
即 m 步转移矩阵就是一步矩阵自乘 m 次。求"经过 m 步从 \( i \) 到 \( j \) 的概率"= 算 \( P^m \) 的第 \( (i,j) \) 个元素。
例 1·二状态链 \( P=\begin{pmatrix}0.28&0.72\\0.08&0.92\end{pmatrix} \),则 \( P^{(2)}=P^2=\begin{pmatrix}0.136&0.864\\0.096&0.904\end{pmatrix} \),故 \( P^{(2)}_{21}=0.096 \);\( P^{(3)}=P^3 \) 同理逐次相乘。

6.5 平衡(平稳)分布

极限分布 对某些链,\( \lim_{m\to\infty}P^m \) 存在,且 \( \lim_{m\to\infty}P^{(m)}_{ij}=\pi_j \) 与起始状态 \( i \) 无关。含义:走足够多步后,"处于状态 \( j \) 的概率"趋于 \( \pi_j \),与从哪开始无关。
平衡 / 平稳分布 (Equilibrium / stationary) \( \{\pi_j\} \) 由下式求解:
\[ (\pi_1,\pi_2,\dots)\,P=(\pi_1,\pi_2,\dots),\qquad \sum_{j\in S}\pi_j=1 \]
含义:若 \( X_0 \) 已服从 \( \{\pi_j\} \),则 \( X_1,X_2,\dots \) 也都服从它——分布"稳定不变"。
例 1 续 解得 \( (\pi_1,\pi_2)=(0.1,0.9) \),且 \( \lim_{m\to\infty}P^m=\begin{pmatrix}0.1&0.9\\0.1&0.9\end{pmatrix} \):无论从哪个状态出发,最终以 0.1 在状态 1、0.9 在状态 2。
例 2·道路退化模型(含吸收态) 路面状态 1=好、2=中、3=需更换:
\[ P=\begin{pmatrix}0.9&0.1&0\\0&0.8&0.2\\0&0&1\end{pmatrix} \]
状态 3 这一行是 \( (0,0,1) \)——一旦进入就再也出不来,叫吸收态 (absorbing state)
道路退化模型的状态转移图
状态转移图 (state transition diagram):圆圈是状态,箭头标注转移概率。状态 1 以 0.9 自环、0.1 转到 2;状态 2 以 0.8 自环、0.2 转到 3;状态 3 以概率 1 自环(吸收态)。这张图与上面的转移矩阵 \( P \) 一一对应:第 \( i \) 行就是从状态 \( i \) 射出的各箭头概率。
若起始为"好",\( P^{(5)}_{13}=0.147,\ P^{(10)}_{13}=0.410,\ P^{(15)}_{13}=0.623 \)。极限 \( \lim_{m\to\infty}P^m=\begin{pmatrix}0&0&1\\0&0&1\\0&0&1\end{pmatrix} \)——道路最终必然需要更换。
没有找到匹配的内容,换个关键词试试。