概率基础 · 核心定义

独立事件、条件概率与无记忆性

这是全站的地基。赌徒谬误为什么错、 预测为什么不可能,全都是本文几个定义的直接推论。 本文不预设概率论基础,从零把它们建起来。

发布 2026-04-11 更新 2026-08-26 约 3400 字 · 阅读约 13 分钟 难度:入门到中等

一、条件概率:把已知信息算进去

概率总是相对于某个信息状态而言的。掷一枚均匀骰子,「点数是 6」的概率是 1/6;但如果已经有人告诉你「点数是偶数」,这个概率就变成了 1/3

条件概率就是把这种「已知」形式化的工具。

P(A | B) = P(A ∩ B) / P(B)   (要求 P(B) > 0) 读作「在 B 已发生的条件下 A 的概率」。这是定义,不是定理。

为什么这样定义?因为「已知 B 发生」相当于把样本空间从整个 Ω 缩小到了 B。在这个新的样本空间里,A 能占多大份额?分子是 A 与 B 的公共部分,分母是新样本空间的总量。分母的作用就是重新归一化。

验算刚才那个骰子例子:A = 点数是 6,B = 点数是偶数。P(A ∩ B) = P(点数是6) = 1/6P(B) = 3/6 = 1/2,所以 P(A|B) = (1/6)/(1/2) = 1/3。与直觉一致。

1.1 乘法公式

把定义两边乘以 P(B),得到极其常用的乘法公式:

P(A ∩ B) = P(B) · P(A | B) = P(A) · P(B | A)

推广到 n 个事件(链式法则):

P(A₁ ∩ A₂ ∩ ⋯ ∩ Aₙ) = P(A₁) · P(A₂|A₁) · P(A₃|A₁∩A₂) ⋯ P(Aₙ|A₁∩⋯∩An−1) 这个公式对任意事件都成立,不需要独立性。独立性做的事,是把每个条件概率都简化成无条件概率。

二、独立性的精确定义

直觉上,「A 与 B 独立」意思是知道 B 发生与否,对判断 A 毫无帮助。写成式子就是 P(A|B) = P(A)

但标准定义采用了对称且不要求 P(B) > 0 的形式:

A 与 B 独立 ⟺ P(A ∩ B) = P(A) · P(B) 这个形式对 A、B 对称,且允许 P(B) = 0

P(B) > 0 时,两种说法等价——把定义代入条件概率:

P(A | B) = P(A ∩ B) / P(B) = P(A)·P(B) / P(B) = P(A)

这一行就是全站的核心

P(A|B) = P(A)「已知 B 发生」这个信息,没有改变 A 的概率。

B 取成「过去所有期的开奖记录」,A 取成「下一期出现某结果」,就直接得到:历史记录不改变下一期的概率。全站其余文章都是这一行的展开。

2.1 独立与互斥完全不是一回事

这两个词经常被混淆,但它们几乎是相反的。

独立与互斥的对照(设 P(A) > 0, P(B) > 0)
维度 独立 互斥(不相容)
定义P(A∩B) = P(A)P(B)A ∩ B = ∅,即 P(A∩B) = 0
含义知道一个不影响另一个两个不可能同时发生
P(A|B)等于 P(A)等于 0
信息量B 关于 A 零信息B 关于 A 信息极大(直接排除 A)
能否兼得两个正概率事件不可能既独立又互斥

最后一行值得验算:若互斥则 P(A∩B) = 0;若独立则 P(A∩B) = P(A)P(B) > 0。矛盾。所以互斥的正概率事件是高度相关的——一个发生了,另一个就绝无可能。

三、两两独立不等于相互独立

对多个事件,独立性的定义要求所有子集都满足乘积公式,而不只是两两配对。对三个事件 A, B, C,相互独立需要四个等式全部成立:

P(A∩B) = P(A)P(B)  P(A∩C) = P(A)P(C)  P(B∩C) = P(B)P(C)
P(A∩B∩C) = P(A)P(B)P(C) 前三条叫「两两独立」。第四条不能由前三条推出。

3.1 伯恩斯坦反例

掷两枚均匀硬币,定义:

  • A = 第一枚是正面
  • B = 第二枚是正面
  • C = 两枚结果相同

四个等可能样本点:正正、正反、反正、反反,各占 1/4。逐一验算:

伯恩斯坦反例:两两独立但不相互独立
事件 样本点 概率 乘积 结论
A正正、正反1/2
B正正、反正1/2
C正正、反反1/2
A∩B正正1/41/4独立 ✓
A∩C正正1/41/4独立 ✓
B∩C正正1/41/4独立 ✓
A∩B∩C正正1/41/8不独立 ✗

三条两两独立全部成立,但三重等式不成立。原因很直观:知道 A 和 B 中的任意一个,对 C 无信息;但同时知道两个,就完全确定了 C。

为什么这个反例重要

它说明「每两个之间看起来都没关系」不足以保证整体无关。做随机性检验时同理:只检查一阶频次均匀,不足以断定序列随机——还必须检查配对频次、游程、自相关等更高阶的结构。这正是 NIST SP 800-22 那类标准测试套件要包含十几项子检验的原因。

四、全概率公式

B₁, B₂, …, Bₙ 是样本空间的一个划分(两两互斥、并集为全集、各自概率为正),则对任意事件 A

P(A) = Σi P(A ∩ Bᵢ) = Σi P(Bᵢ) · P(A | Bᵢ) 把 A 按「情形」拆开,分别算再加权求和。这是概率计算最常用的分解手段。

一个算例。某摇号装置有两台机器,A 机使用 70% 的场次,B 机使用 30%。A 机经检验完全均匀(某结果出现概率 1/49),B 机因磨损略有偏差(该结果概率 1/45)。随机抽一场,该结果出现的概率是:

P = 0.7 × (1/49) + 0.3 × (1/45) = 0.014286 + 0.006667 = 0.020952

对照完全均匀情形下的 1/49 = 0.020408,混合后的概率略高。注意这里的偏差来自装置的物理属性,不是来自历史序列——这个区别在第八节还会回来。

五、贝叶斯定理与一个反直觉算例

把乘法公式的两种写法联立 P(A)P(B|A) = P(B)P(A|B),整理即得:

P(B | A) = P(A | B) · P(B) / P(A) 配合全概率公式展开分母,就是完整形式的贝叶斯定理。

5.1 检测问题算例

假设某种设备故障的发生率是 0.1%。有一套检测程序:设备真有故障时,99% 能报出来(灵敏度 99%);设备正常时,也有 5% 会误报(特异度 95%)。

现在检测报警了。设备真有故障的概率是多少?

先设事件:D = 真有故障,+ = 检测报警。已知 P(D) = 0.001P(+|D) = 0.99P(+|¬D) = 0.05

第一步,用全概率公式算 P(+)

P(+) = P(D)P(+|D) + P(¬D)P(+|¬D)
= 0.001 × 0.99 + 0.999 × 0.05
= 0.00099 + 0.049950 = 0.050940

第二步,代入贝叶斯定理:

P(D | +) = 0.00099 / 0.050940 ≈ 0.0194 约 1.94%。即:报警之后,真有故障的概率仍不到 2%。

基础率谬误

很多人会脱口而出「99%」,因为灵敏度是 99%。但那是 P(+|D),问的却是 P(D|+)——两者方向相反,数值可以差 50 倍。

关键在于基础率:故障本来就极其罕见(0.1%),而误报率虽然只有 5%,却作用在 99.9% 的正常设备上。1000 台设备里,真故障 1 台(报警约 1 台),正常 999 台(误报约 50 台)。所以 51 次报警里只有 1 次是真的。

这个结构在判断「某个统计发现是否真实」时会反复出现:当真规律本来就极其稀少时,即使检验很准,报出来的多数也是假阳性。详见《冷热号的统计学真相》里的多重比较部分。

六、无记忆性的严格证明

现在证明本文标题里的第三个概念。设每次试验成功概率为 p,令 X 表示首次成功所需的试验次数X 服从几何分布:

P(X = k) = (1 − p)k−1 · p   (k = 1, 2, 3, …) k−1 次都失败,第 k 次成功。由独立性,概率相乘。

先算尾概率 P(X > n),即「前 n 次全部失败」:

P(X > n) = (1 − p)n

6.1 定理与证明

无记忆性:对任意非负整数 m, n

P(X > m + n | X > m) = P(X > n)

证明。注意事件 {X > m+n}{X > m} 的子集(等更久必然已经等过 m),所以两者的交集就是 {X > m+n} 本身。于是:

P(X > m+n | X > m) = P(X > m+n) / P(X > m)
= (1−p)m+n / (1−p)m
= (1−p)n = P(X > n)  ∎ 分子分母的 (1−p)m 完整约掉,m 从结果中消失。

用中文说:已经等了 m 次还没成功,接下来还要再等多久的分布,和刚开始等的时候一模一样。之前等的那 m 次,一点都不算数。

6.2 实测验证

下图是数值验证。取 p = 1/6,模拟大量几何分布样本,然后对不同的 m 分别计算条件概率 P(X > m+5 | X > m)。如果无记忆性成立,这些值应该全部等于 P(X > 5) = (5/6)⁵ ≈ 0.4019,与 m 无关。

已经等了 m 次之后,再等 5 次仍不成功的实测频率

p = 1/6,200 万次几何分布模拟,随机种子 20260411(固定,可复现)。理论值 (5/6)⁵ ≈ 0.4019。

柱子全部落在理论线上。「已经等了 20 次」和「刚开始等」,对未来的分布毫无差别。这就是赌徒谬误在分布层面的对应表述。

一个值得记住的事实

在所有离散分布中,几何分布是唯一具有无记忆性的;在连续分布中,指数分布是唯一的。也就是说,无记忆性这个性质刻画了这两个分布——它不是一个巧合,而是独立重复试验的必然结构。

七、连续版本:指数分布

把「第几次」换成「等多久」,几何分布的连续对应物是指数分布:

P(T > t) = e−λt   (t ≥ 0, λ > 0)

同样的两行推导:

P(T > s+t | T > s) = e−λ(s+t) / e−λs = e−λt = P(T > t)

指数函数的这个性质来自 e^{a+b} = e^a · e^b——无记忆性本质上就是指数函数的加法定理。反过来,能证明满足 f(s+t) = f(s)f(t) 的连续单调函数只有指数函数,这就是「指数分布是唯一无记忆连续分布」的来源。

八、独立性什么时候会被破坏

前面所有结论都建立在独立性上。诚实地说清它在什么情况下不成立,比反复强调它成立更有价值。

8.1 无放回抽样:超几何取代二项

从一副 52 张牌里连续抽两张不放回。第一张是红桃的概率是 13/52 = 1/4。若第一张确实是红桃,第二张是红桃的概率变成 12/51 ≈ 0.2353——降低了。这两次抽取不独立

这就是二项分布与超几何分布的分野:有放回用二项,无放回用超几何。摇号装置在单期之内是无放回的(同一期不会出现重复号码),所以单期内各号码之间存在轻微的负相关。但期与期之间是完全独立的,因为每期开始前所有号码都归位。完整推导见《组合数学:中奖概率是怎么算出来的》。

8.2 装置本身有物理偏差

如果轮盘倾斜、骰子重心偏移、某个号码球磨损变轻,那么各次结果仍然相互独立,但不再同分布于均匀分布——概率 p 不等于 1/49 了。

这是唯一一种历史数据有用的情形,而且方向和直觉相反

装置有偏时,历史数据确实包含信息——但它包含的是「这台机器偏向谁」的信息,不是「下一次开什么」的信息。而且推断方向恰好与赌徒谬误相反:若检验发现某结果系统性偏多,正确结论是它未来还会偏多(机器偏向它),而不是「该轮到别的了」。

怎样用统计检验判断装置是否有偏,见《随机性检验:卡方统计量与 p 值》。需要说明的是,现代摇号装置的检验记录通常显示不出可利用的偏差——而且即便存在微小偏差,它带来的期望改善也远小于 1 − R 这个固定的负项,见《期望值与返奖率》。

8.3 伪随机数生成器的周期性

软件生成的随机数是随机的:由确定性算法产生,有限周期,理论上完全可预测(知道种子和算法即可)。本站所有模拟用的 mulberry32 就是这样一个生成器——这正是为什么本站的图能被任何人精确复现。

对科普演示这完全够用,但它提醒我们:独立性是一个建模假设,不是自然法则。它对不对,要靠检验来回答,不能靠断言。


延伸阅读与参考

  • Ross, S. A First Course in Probability (10th ed.). 第 3 章条件概率与独立性,含大量算例。
  • Feller, W. An Introduction to Probability Theory and Its Applications, Vol. 1 (3rd ed.). 第 5 章条件概率与随机独立性;第 13 章几何分布与等待时间。
  • Grinstead, C. M. & Snell, J. L. Introduction to Probability (2nd ed., AMS). 第 4 章条件概率,可免费获取。
  • Bernstein, S. N. Theory of Probability (1927). 两两独立反例的最初来源。
  • Casella, G. & Berger, R. L. Statistical Inference (2nd ed.). 第 3 章关于无记忆性刻画的讨论。
  • Kahneman, D. & Tversky, A. (1973). On the psychology of prediction. Psychological Review, 80(4), 237–251. 基础率谬误的经典研究。