一、被拿来当靠山的那句话
「次数多了,各个结果的出现比例总会趋于均匀。」
这句话本身是对的,它就是大数定律的通俗版本。麻烦出在下一步:很多人从它推出「所以出现少的那个,后面会多出来补上」。
这一步推理是错的,而且错得很干净——不是近似成立、不是小概率例外,是根本不成立。要看清错在哪,得先把这句通俗话翻译成数学。
本文要说清的一件事
大数定律断言的是 Sₙ/n → p(频率收敛),它没有断言 Sₙ − np → 0(次数补偿)。事实上后者是假的:|Sₙ − np| 的典型大小会随 √n 持续增长。
二、弱大数定律的精确表述
2.1 记号
设 X₁, X₂, … 是独立同分布的随机变量,每个取值 0 或 1,取 1 的概率为 p。记前 n 次的成功次数为:
Sₙ/n,「理论次数」是 np。全文都用这套记号。
基本事实(由期望的线性性与独立性):
2.2 弱大数定律(伯努利,1713)
对任意给定的 ε > 0:
p 超过 ε 这件事,其概率趋于零。这叫依概率收敛。
请逐字读这个表述,它比通俗版本谨慎得多:
- 它谈的是
Sₙ/n,不是Sₙ。分母在里面。 - 它谈的是「偏离超过 ε 的概率趋于零」,不是「偏离本身趋于零」。
- 它对任何具体的
n都没说什么。它只说n → ∞时的极限行为。 - 它对下一次
X_{n+1}完全沉默。定理的陈述里根本没有这个变量。
最后一条尤其重要。一个不提及 X_{n+1} 的定理,无论如何都推不出关于 X_{n+1} 的结论。这是逻辑,不是概率。
三、用切比雪夫不等式证明它
证明只有三行,值得亲手过一遍——看懂了证明,就不可能再误用这个定理。
3.1 马尔可夫不等式
设 Y ≥ 0 是非负随机变量,a > 0,则:
直觉:如果一个非负量经常很大,它的平均值就不可能小。
3.2 切比雪夫不等式
把马尔可夫不等式用在 Y = (Z − E[Z])² 上,取 a = ε²:
ε 以上的概率,被方差除以 ε² 压住。
3.3 代入 Z = Sₙ/n
先算这个量的方差。由 Var(aX) = a²Var(X):
代进切比雪夫:
n 增大而趋于 0,证毕。
现在看清楚收敛是从哪来的:右边那个 n 在分母上。收敛的全部来源,是 Var(Sₙ) = np(1−p) 除以了 n²。
换句话说,方差本身在随 n 线性增长(np(1−p) 越来越大),只是被 n² 压过去了。整个证明里没有任何一步用到「后续结果会往回调」——事实上证明用到的恰恰是相反的假设:各次试验相互独立,谁也不受谁影响。
证明给出的额外信息
不等式 P(|Sₙ/n − p| ≥ ε) ≤ p(1−p)/(nε²) 是定量的,可以直接用。取 p = 0.5、ε = 0.01、n = 10000:右边 = 0.25/(10000×0.0001) = 0.25。即:一万次投掷后频率偏离 0.5 超过 1 个百分点的概率不超过 25%。(这是个很宽松的上界,实际值约 4.6%,用中心极限定理可以算得更准。)
四、强大数定律与两者的区别
强大数定律(柯尔莫哥洛夫)的表述是:
p」这个事件的概率是 1。这叫几乎必然收敛。
注意极限符号的位置变了:弱定律是 lim P(…),强定律是 P(lim …)。这个位置差别不是形式游戏。
| 维度 | 弱大数定律 | 强大数定律 |
|---|---|---|
| 收敛类型 | 依概率收敛 | 几乎必然收敛 |
| 形式 | lim P(|Sₙ/n − p| ≥ ε) = 0 |
P(lim Sₙ/n = p) = 1 |
| 说的是 | 对每个固定的大 n,偏离是小概率事件 | 对几乎每一条无穷轨迹,序列本身收敛 |
| 允许什么 | 允许偏离无穷多次发生(只要越来越稀) | 偏离只能发生有限次 |
| 强弱关系 | 较弱,可由强定律推出 | 较强,推不回去 |
「允许什么」那一行是理解差别的钥匙。弱定律不排除这种情况:某条轨迹在 n = 10⁶, 10¹², 10²⁴, … 处反复出现大偏离,只要这些时刻越来越稀疏,lim P(…) = 0 依然成立。强定律排除了这种情况——对几乎所有轨迹,大偏离只发生有限多次,此后永远不再出现。
但请注意:即使是更强的强大数定律,也依然只说 Sₙ/n,不说 Sₙ − np。无论用哪个版本,都推不出补偿。
五、稀释,不是补偿
现在用具体数字把这件事钉死。假设前 100 次投掷出现了 60 次正面:
- 频率:
60/100 = 0.600,偏离 0.5 有 0.100 - 绝对次数偏差:
60 − 50 = 10次
现在继续投 9900 次。按期望,这 9900 次里会出现约 4950 次正面。于是:
- 总次数 10000,总正面数
60 + 4950 = 5010 - 频率:
5010/10000 = 0.501,偏离 0.5 只有 0.001 了 - 绝对次数偏差:
5010 − 5000 = 10次
看那个 10
频率从 0.600 收敛到了 0.501,非常漂亮。但绝对偏差还是 10 次,一次都没被补回来。
频率之所以收敛,是因为分母从 100 涨到了 10000,把同样大小的偏差稀释了一百倍。稀释,不是补偿。这两个词的区别,就是大数定律与赌徒谬误的全部区别。
把这张表补全,看得更清楚:
| 总投掷次数 n | 正面次数 Sₙ | 频率 Sₙ/n | 绝对偏差 Sₙ − n/2 |
|---|---|---|---|
| 100 | 60 | 0.6000 | +10 |
| 1,000 | 510 | 0.5100 | +10 |
| 10,000 | 5,010 | 0.5010 | +10 |
| 100,000 | 50,010 | 0.5001 | +10 |
| 1,000,000 | 500,010 | 0.50001 | +10 |
第三列在向 0.5 收敛,第四列纹丝不动。大数定律管的是第三列。
六、绝对偏差其实在变大
上一节为了讲清楚,假设后续投掷「恰好按期望」。真实情况比这更不利于「补偿」说——真实的绝对偏差不但不缩小,反而会持续增长。
因为 Var(Sₙ) = np(1−p),所以标准差是:
|Sₙ − np| 的典型大小就是这个量级,随 √n 增长。
下图把两件事画在一起对比。左边那条是频率偏差 |Sₙ/n − 0.5|,右边那条是绝对次数偏差 |Sₙ − n/2|,同一批模拟数据、同一个随机种子:
频率偏差 |Sₙ/n − 0.5| 随 n 递减
三条独立轨迹,随机种子 20260328 / 19260817 / 31337007(固定,可复现)。横轴对数刻度。
同一批数据的绝对次数偏差 |Sₙ − n/2| 随 n 递增
与上图完全相同的三条轨迹,只是纵轴换成了绝对次数。参考曲线为 0.5√n(理论标准差)。
两张图用的是同一批数字,只是换了纵轴。上图在往下走,下图在往上走。如果「补偿」真的存在,下图应该向 0 收敛——它没有,它沿着 √n 往上爬。
这是对「回归」说法最直接的反驳
「出现少的会补回来」如果成立,绝对偏差必须缩小。实测和理论都表明它在增长。所谓的「回归」只发生在比值上,而比值的回归靠的是分母变大,跟分子上少的那几次一点关系都没有。
七、中心极限定理补上最后一块
大数定律说频率收敛,但没说收敛得多快、偏差怎么分布。中心极限定理(CLT)补上了这一块:
有了 CLT,就能把前面切比雪夫给出的宽松上界算精确。仍取 p = 0.5、n = 10000、ε = 0.01:
约 4.6%,而切比雪夫给的上界是 25%。两者都对——切比雪夫是不需要任何分布假设的保守界,CLT 用了正态近似所以更准。
CLT 还顺带解释了为什么「看起来在赢」这种错觉如此普遍:偏差的典型幅度是 √n 量级,所以在任何有限的观察窗口里,总会看到持续偏向一侧的走势。这些走势是纯粹的随机波动,但人眼会把它读成趋势。详见《冷热号的统计学真相》。
八、四种常见误用
误用一:「次数够多就会均匀,所以缺的会补上」
错在把 Sₙ/n → p 读成了 Sₙ − np → 0。第五、六节已经证明后者是假的。
误用二:「大数定律保证长期一定回本」
大数定律确实保证长期结果收敛——但收敛到的是期望值,而不是 0。当单位期望为 R − 1 < 0 时,大数定律保证的恰恰是长期亏损趋于确定。它是反过来用的。见《期望值与返奖率》。
误用三:「n 已经很大了,所以现在的偏差不正常」
要判断一个偏差是否异常,得用统计检验算 p 值,不能凭「n 很大了」这种感觉。按 CLT,n = 10000 时出现 100 次以上的绝对偏差,概率有 4.6%,完全正常。
误用四:把大数定律用在不独立的场合
本文所有推导都用了独立性(第三节里 Var(Sₙ) = np(1−p) 这一步)。若各次试验相关,方差可加就不成立,结论要重新讨论。不过对于合格的摇号装置,独立性正是设计目标。
延伸阅读与参考
- Feller, W. An Introduction to Probability Theory and Its Applications, Vol. 1 (3rd ed.). 第 8 章「大数定律」,第 3 章关于波动与游程的讨论尤其值得读。
- Billingsley, P. Probability and Measure (3rd ed.). 第 6 节弱大数定律,第 22 节强大数定律的柯尔莫哥洛夫证明。
- Durrett, R. Probability: Theory and Examples (5th ed.). 第 2 章各类收敛概念的系统对比。
- Ross, S. A First Course in Probability (10th ed.). 第 8 章极限定理,含切比雪夫不等式的初等处理。
- Bernoulli, J. Ars Conjectandi (1713). 弱大数定律的最初来源。