一、条件概率:把已知信息算进去
概率总是相对于某个信息状态而言的。掷一枚均匀骰子,「点数是 6」的概率是 1/6;但如果已经有人告诉你「点数是偶数」,这个概率就变成了 1/3。
条件概率就是把这种「已知」形式化的工具。
为什么这样定义?因为「已知 B 发生」相当于把样本空间从整个 Ω 缩小到了 B。在这个新的样本空间里,A 能占多大份额?分子是 A 与 B 的公共部分,分母是新样本空间的总量。分母的作用就是重新归一化。
验算刚才那个骰子例子:A = 点数是 6,B = 点数是偶数。P(A ∩ B) = P(点数是6) = 1/6,P(B) = 3/6 = 1/2,所以 P(A|B) = (1/6)/(1/2) = 1/3。与直觉一致。
1.1 乘法公式
把定义两边乘以 P(B),得到极其常用的乘法公式:
推广到 n 个事件(链式法则):
二、独立性的精确定义
直觉上,「A 与 B 独立」意思是知道 B 发生与否,对判断 A 毫无帮助。写成式子就是 P(A|B) = P(A)。
但标准定义采用了对称且不要求 P(B) > 0 的形式:
P(B) = 0。
当 P(B) > 0 时,两种说法等价——把定义代入条件概率:
这一行就是全站的核心
P(A|B) = P(A):「已知 B 发生」这个信息,没有改变 A 的概率。
把 B 取成「过去所有期的开奖记录」,A 取成「下一期出现某结果」,就直接得到:历史记录不改变下一期的概率。全站其余文章都是这一行的展开。
2.1 独立与互斥完全不是一回事
这两个词经常被混淆,但它们几乎是相反的。
| 维度 | 独立 | 互斥(不相容) |
|---|---|---|
| 定义 | P(A∩B) = P(A)P(B) | A ∩ B = ∅,即 P(A∩B) = 0 |
| 含义 | 知道一个不影响另一个 | 两个不可能同时发生 |
P(A|B) | 等于 P(A) | 等于 0 |
| 信息量 | B 关于 A 零信息 | B 关于 A 信息极大(直接排除 A) |
| 能否兼得 | 两个正概率事件不可能既独立又互斥 | |
最后一行值得验算:若互斥则 P(A∩B) = 0;若独立则 P(A∩B) = P(A)P(B) > 0。矛盾。所以互斥的正概率事件是高度相关的——一个发生了,另一个就绝无可能。
三、两两独立不等于相互独立
对多个事件,独立性的定义要求所有子集都满足乘积公式,而不只是两两配对。对三个事件 A, B, C,相互独立需要四个等式全部成立:
P(A∩B∩C) = P(A)P(B)P(C) 前三条叫「两两独立」。第四条不能由前三条推出。
3.1 伯恩斯坦反例
掷两枚均匀硬币,定义:
A= 第一枚是正面B= 第二枚是正面C= 两枚结果相同
四个等可能样本点:正正、正反、反正、反反,各占 1/4。逐一验算:
| 事件 | 样本点 | 概率 | 乘积 | 结论 |
|---|---|---|---|---|
| A | 正正、正反 | 1/2 | — | — |
| B | 正正、反正 | 1/2 | — | — |
| C | 正正、反反 | 1/2 | — | — |
| A∩B | 正正 | 1/4 | 1/4 | 独立 ✓ |
| A∩C | 正正 | 1/4 | 1/4 | 独立 ✓ |
| B∩C | 正正 | 1/4 | 1/4 | 独立 ✓ |
| A∩B∩C | 正正 | 1/4 | 1/8 | 不独立 ✗ |
三条两两独立全部成立,但三重等式不成立。原因很直观:知道 A 和 B 中的任意一个,对 C 无信息;但同时知道两个,就完全确定了 C。
为什么这个反例重要
它说明「每两个之间看起来都没关系」不足以保证整体无关。做随机性检验时同理:只检查一阶频次均匀,不足以断定序列随机——还必须检查配对频次、游程、自相关等更高阶的结构。这正是 NIST SP 800-22 那类标准测试套件要包含十几项子检验的原因。
四、全概率公式
设 B₁, B₂, …, Bₙ 是样本空间的一个划分(两两互斥、并集为全集、各自概率为正),则对任意事件 A:
一个算例。某摇号装置有两台机器,A 机使用 70% 的场次,B 机使用 30%。A 机经检验完全均匀(某结果出现概率 1/49),B 机因磨损略有偏差(该结果概率 1/45)。随机抽一场,该结果出现的概率是:
对照完全均匀情形下的 1/49 = 0.020408,混合后的概率略高。注意这里的偏差来自装置的物理属性,不是来自历史序列——这个区别在第八节还会回来。
五、贝叶斯定理与一个反直觉算例
把乘法公式的两种写法联立 P(A)P(B|A) = P(B)P(A|B),整理即得:
5.1 检测问题算例
假设某种设备故障的发生率是 0.1%。有一套检测程序:设备真有故障时,99% 能报出来(灵敏度 99%);设备正常时,也有 5% 会误报(特异度 95%)。
现在检测报警了。设备真有故障的概率是多少?
先设事件:D = 真有故障,+ = 检测报警。已知 P(D) = 0.001,P(+|D) = 0.99,P(+|¬D) = 0.05。
第一步,用全概率公式算 P(+):
= 0.001 × 0.99 + 0.999 × 0.05
= 0.00099 + 0.049950 = 0.050940
第二步,代入贝叶斯定理:
基础率谬误
很多人会脱口而出「99%」,因为灵敏度是 99%。但那是 P(+|D),问的却是 P(D|+)——两者方向相反,数值可以差 50 倍。
关键在于基础率:故障本来就极其罕见(0.1%),而误报率虽然只有 5%,却作用在 99.9% 的正常设备上。1000 台设备里,真故障 1 台(报警约 1 台),正常 999 台(误报约 50 台)。所以 51 次报警里只有 1 次是真的。
这个结构在判断「某个统计发现是否真实」时会反复出现:当真规律本来就极其稀少时,即使检验很准,报出来的多数也是假阳性。详见《冷热号的统计学真相》里的多重比较部分。
六、无记忆性的严格证明
现在证明本文标题里的第三个概念。设每次试验成功概率为 p,令 X 表示首次成功所需的试验次数。X 服从几何分布:
k−1 次都失败,第 k 次成功。由独立性,概率相乘。
先算尾概率 P(X > n),即「前 n 次全部失败」:
6.1 定理与证明
无记忆性:对任意非负整数 m, n,
证明。注意事件 {X > m+n} 是 {X > m} 的子集(等更久必然已经等过 m),所以两者的交集就是 {X > m+n} 本身。于是:
= (1−p)m+n / (1−p)m
= (1−p)n = P(X > n) ∎ 分子分母的
(1−p)m 完整约掉,m 从结果中消失。
用中文说:已经等了 m 次还没成功,接下来还要再等多久的分布,和刚开始等的时候一模一样。之前等的那 m 次,一点都不算数。
6.2 实测验证
下图是数值验证。取 p = 1/6,模拟大量几何分布样本,然后对不同的 m 分别计算条件概率 P(X > m+5 | X > m)。如果无记忆性成立,这些值应该全部等于 P(X > 5) = (5/6)⁵ ≈ 0.4019,与 m 无关。
已经等了 m 次之后,再等 5 次仍不成功的实测频率
p = 1/6,200 万次几何分布模拟,随机种子 20260411(固定,可复现)。理论值 (5/6)⁵ ≈ 0.4019。
柱子全部落在理论线上。「已经等了 20 次」和「刚开始等」,对未来的分布毫无差别。这就是赌徒谬误在分布层面的对应表述。
一个值得记住的事实
在所有离散分布中,几何分布是唯一具有无记忆性的;在连续分布中,指数分布是唯一的。也就是说,无记忆性这个性质刻画了这两个分布——它不是一个巧合,而是独立重复试验的必然结构。
七、连续版本:指数分布
把「第几次」换成「等多久」,几何分布的连续对应物是指数分布:
同样的两行推导:
指数函数的这个性质来自 e^{a+b} = e^a · e^b——无记忆性本质上就是指数函数的加法定理。反过来,能证明满足 f(s+t) = f(s)f(t) 的连续单调函数只有指数函数,这就是「指数分布是唯一无记忆连续分布」的来源。
八、独立性什么时候会被破坏
前面所有结论都建立在独立性上。诚实地说清它在什么情况下不成立,比反复强调它成立更有价值。
8.1 无放回抽样:超几何取代二项
从一副 52 张牌里连续抽两张不放回。第一张是红桃的概率是 13/52 = 1/4。若第一张确实是红桃,第二张是红桃的概率变成 12/51 ≈ 0.2353——降低了。这两次抽取不独立。
这就是二项分布与超几何分布的分野:有放回用二项,无放回用超几何。摇号装置在单期之内是无放回的(同一期不会出现重复号码),所以单期内各号码之间存在轻微的负相关。但期与期之间是完全独立的,因为每期开始前所有号码都归位。完整推导见《组合数学:中奖概率是怎么算出来的》。
8.2 装置本身有物理偏差
如果轮盘倾斜、骰子重心偏移、某个号码球磨损变轻,那么各次结果仍然相互独立,但不再同分布于均匀分布——概率 p 不等于 1/49 了。
这是唯一一种历史数据有用的情形,而且方向和直觉相反
装置有偏时,历史数据确实包含信息——但它包含的是「这台机器偏向谁」的信息,不是「下一次开什么」的信息。而且推断方向恰好与赌徒谬误相反:若检验发现某结果系统性偏多,正确结论是它未来还会偏多(机器偏向它),而不是「该轮到别的了」。
怎样用统计检验判断装置是否有偏,见《随机性检验:卡方统计量与 p 值》。需要说明的是,现代摇号装置的检验记录通常显示不出可利用的偏差——而且即便存在微小偏差,它带来的期望改善也远小于 1 − R 这个固定的负项,见《期望值与返奖率》。
8.3 伪随机数生成器的周期性
软件生成的随机数是伪随机的:由确定性算法产生,有限周期,理论上完全可预测(知道种子和算法即可)。本站所有模拟用的 mulberry32 就是这样一个生成器——这正是为什么本站的图能被任何人精确复现。
对科普演示这完全够用,但它提醒我们:独立性是一个建模假设,不是自然法则。它对不对,要靠检验来回答,不能靠断言。
延伸阅读与参考
- Ross, S. A First Course in Probability (10th ed.). 第 3 章条件概率与独立性,含大量算例。
- Feller, W. An Introduction to Probability Theory and Its Applications, Vol. 1 (3rd ed.). 第 5 章条件概率与随机独立性;第 13 章几何分布与等待时间。
- Grinstead, C. M. & Snell, J. L. Introduction to Probability (2nd ed., AMS). 第 4 章条件概率,可免费获取。
- Bernstein, S. N. Theory of Probability (1927). 两两独立反例的最初来源。
- Casella, G. & Berger, R. L. Statistical Inference (2nd ed.). 第 3 章关于无记忆性刻画的讨论。
- Kahneman, D. & Tversky, A. (1973). On the psychology of prediction. Psychological Review, 80(4), 237–251. 基础率谬误的经典研究。