极限定理 · 收敛

大数定律到底保证了什么

几乎所有关于「走势会回归」的说法,都会拿大数定律当靠山。 问题是,大数定律说的根本不是那个意思。本文给出它的精确表述、完整证明, 以及一张图——那张图会让「补偿」这个想法彻底站不住脚。

发布 2026-03-28 更新 2026-08-25 约 3600 字 · 阅读约 14 分钟 难度:中等

一、被拿来当靠山的那句话

「次数多了,各个结果的出现比例总会趋于均匀。」

这句话本身是对的,它就是大数定律的通俗版本。麻烦出在下一步:很多人从它推出「所以出现少的那个,后面会多出来补上」。

这一步推理是错的,而且错得很干净——不是近似成立、不是小概率例外,是根本不成立。要看清错在哪,得先把这句通俗话翻译成数学。

本文要说清的一件事

大数定律断言的是 Sₙ/n → p(频率收敛),它没有断言 Sₙ − np → 0(次数补偿)。事实上后者是假的|Sₙ − np| 的典型大小会随 √n 持续增长。

二、弱大数定律的精确表述

2.1 记号

X₁, X₂, … 是独立同分布的随机变量,每个取值 0 或 1,取 1 的概率为 p。记前 n 次的成功次数为:

Sₙ = X₁ + X₂ + ⋯ + Xₙ 于是「频率」就是 Sₙ/n,「理论次数」是 np。全文都用这套记号。

基本事实(由期望的线性性与独立性):

E[Sₙ] = np    Var(Sₙ) = np(1 − p) 方差可加要求独立性;期望可加则不需要任何条件。这个区别后面会用到。

2.2 弱大数定律(伯努利,1713)

对任意给定的 ε > 0

limn→∞ P( |Sₙ/n − p| ≥ ε ) = 0 读作:频率偏离 p 超过 ε 这件事,其概率趋于零。这叫依概率收敛

请逐字读这个表述,它比通俗版本谨慎得多:

  • 它谈的是 Sₙ/n,不是 Sₙ分母在里面。
  • 它谈的是「偏离超过 ε 的概率趋于零」,不是「偏离本身趋于零」。
  • 它对任何具体的 n 都没说什么。它只说 n → ∞ 时的极限行为。
  • 它对下一次 X_{n+1} 完全沉默。定理的陈述里根本没有这个变量。

最后一条尤其重要。一个不提及 X_{n+1} 的定理,无论如何都推不出关于 X_{n+1} 的结论。这是逻辑,不是概率。

三、用切比雪夫不等式证明它

证明只有三行,值得亲手过一遍——看懂了证明,就不可能再误用这个定理。

3.1 马尔可夫不等式

Y ≥ 0 是非负随机变量,a > 0,则:

P(Y ≥ a) ≤ E[Y] / a

直觉:如果一个非负量经常很大,它的平均值就不可能小。

3.2 切比雪夫不等式

把马尔可夫不等式用在 Y = (Z − E[Z])² 上,取 a = ε²

P( |Z − E[Z]| ≥ ε ) = P( (Z − E[Z])² ≥ ε² ) ≤ Var(Z) / ε² 这就是切比雪夫不等式:偏离均值 ε 以上的概率,被方差除以 ε² 压住。

3.3 代入 Z = Sₙ/n

先算这个量的方差。由 Var(aX) = a²Var(X)

Var(Sₙ/n) = Var(Sₙ) / n² = np(1 − p) / n² = p(1 − p) / n

代进切比雪夫:

P( |Sₙ/n − p| ≥ ε ) ≤ p(1 − p) / (n ε²) 右边随 n 增大而趋于 0,证毕。

现在看清楚收敛是从哪来的:右边那个 n分母上。收敛的全部来源,是 Var(Sₙ) = np(1−p) 除以了

换句话说,方差本身在随 n 线性增长np(1−p) 越来越大),只是被 压过去了。整个证明里没有任何一步用到「后续结果会往回调」——事实上证明用到的恰恰是相反的假设:各次试验相互独立,谁也不受谁影响。

证明给出的额外信息

不等式 P(|Sₙ/n − p| ≥ ε) ≤ p(1−p)/(nε²) 是定量的,可以直接用。取 p = 0.5ε = 0.01n = 10000:右边 = 0.25/(10000×0.0001) = 0.25。即:一万次投掷后频率偏离 0.5 超过 1 个百分点的概率不超过 25%。(这是个很宽松的上界,实际值约 4.6%,用中心极限定理可以算得更准。)

四、强大数定律与两者的区别

强大数定律(柯尔莫哥洛夫)的表述是:

P( limn→∞ Sₙ/n = p ) = 1 读作:「频率序列收敛到 p」这个事件的概率是 1。这叫几乎必然收敛

注意极限符号的位置变了:弱定律是 lim P(…),强定律是 P(lim …)。这个位置差别不是形式游戏。

弱大数定律与强大数定律的对照
维度 弱大数定律 强大数定律
收敛类型 依概率收敛 几乎必然收敛
形式 lim P(|Sₙ/n − p| ≥ ε) = 0 P(lim Sₙ/n = p) = 1
说的是 对每个固定的大 n,偏离是小概率事件 对几乎每一条无穷轨迹,序列本身收敛
允许什么 允许偏离无穷多次发生(只要越来越稀) 偏离只能发生有限次
强弱关系 较弱,可由强定律推出 较强,推不回去

「允许什么」那一行是理解差别的钥匙。弱定律不排除这种情况:某条轨迹在 n = 10⁶, 10¹², 10²⁴, … 处反复出现大偏离,只要这些时刻越来越稀疏,lim P(…) = 0 依然成立。强定律排除了这种情况——对几乎所有轨迹,大偏离只发生有限多次,此后永远不再出现。

但请注意:即使是更强的强大数定律,也依然只说 Sₙ/n,不说 Sₙ − np无论用哪个版本,都推不出补偿。

五、稀释,不是补偿

现在用具体数字把这件事钉死。假设前 100 次投掷出现了 60 次正面:

  • 频率:60/100 = 0.600,偏离 0.5 有 0.100
  • 绝对次数偏差:60 − 50 = 10

现在继续投 9900 次。按期望,这 9900 次里会出现约 4950 次正面。于是:

  • 总次数 10000,总正面数 60 + 4950 = 5010
  • 频率:5010/10000 = 0.501,偏离 0.5 只有 0.001 了
  • 绝对次数偏差:5010 − 5000 = 10

看那个 10

频率从 0.600 收敛到了 0.501,非常漂亮。但绝对偏差还是 10 次,一次都没被补回来

频率之所以收敛,是因为分母从 100 涨到了 10000,把同样大小的偏差稀释了一百倍。稀释,不是补偿。这两个词的区别,就是大数定律与赌徒谬误的全部区别。

把这张表补全,看得更清楚:

前 100 次多出 10 次正面,之后按期望继续投掷
总投掷次数 n 正面次数 Sₙ 频率 Sₙ/n 绝对偏差 Sₙ − n/2
100600.6000+10
1,0005100.5100+10
10,0005,0100.5010+10
100,00050,0100.5001+10
1,000,000500,0100.50001+10

第三列在向 0.5 收敛,第四列纹丝不动。大数定律管的是第三列。

六、绝对偏差其实在变大

上一节为了讲清楚,假设后续投掷「恰好按期望」。真实情况比这更不利于「补偿」说——真实的绝对偏差不但不缩小,反而会持续增长

因为 Var(Sₙ) = np(1−p),所以标准差是:

σ(Sₙ) = √(n·p(1−p))    p = 0.5 时 = 0.5√n |Sₙ − np| 的典型大小就是这个量级,随 √n 增长。

下图把两件事画在一起对比。左边那条是频率偏差 |Sₙ/n − 0.5|,右边那条是绝对次数偏差 |Sₙ − n/2|,同一批模拟数据、同一个随机种子:

频率偏差 |Sₙ/n − 0.5| 随 n 递减

三条独立轨迹,随机种子 20260328 / 19260817 / 31337007(固定,可复现)。横轴对数刻度。

同一批数据的绝对次数偏差 |Sₙ − n/2| 随 n 递增

与上图完全相同的三条轨迹,只是纵轴换成了绝对次数。参考曲线为 0.5√n(理论标准差)。

两张图用的是同一批数字,只是换了纵轴。上图在往下走,下图在往上走。如果「补偿」真的存在,下图应该向 0 收敛——它没有,它沿着 √n 往上爬。

这是对「回归」说法最直接的反驳

「出现少的会补回来」如果成立,绝对偏差必须缩小。实测和理论都表明它在增长。所谓的「回归」只发生在比值上,而比值的回归靠的是分母变大,跟分子上少的那几次一点关系都没有。

七、中心极限定理补上最后一块

大数定律说频率收敛,但没说收敛得多快、偏差怎么分布。中心极限定理(CLT)补上了这一块:

(Sₙ − np) / √(np(1−p))  →  N(0, 1) 标准化后的偏差依分布收敛到标准正态分布。这给出了偏差的完整分布形状。

有了 CLT,就能把前面切比雪夫给出的宽松上界算精确。仍取 p = 0.5n = 10000ε = 0.01

P(|Sₙ/n − 0.5| ≥ 0.01) = P(|Sₙ − 5000| ≥ 100) ≈ 2·Φ(−100/50) = 2·Φ(−2) ≈ 0.0455

约 4.6%,而切比雪夫给的上界是 25%。两者都对——切比雪夫是不需要任何分布假设的保守界,CLT 用了正态近似所以更准。

CLT 还顺带解释了为什么「看起来在赢」这种错觉如此普遍:偏差的典型幅度是 √n 量级,所以在任何有限的观察窗口里,总会看到持续偏向一侧的走势。这些走势是纯粹的随机波动,但人眼会把它读成趋势。详见《冷热号的统计学真相》。

八、四种常见误用

误用一:「次数够多就会均匀,所以缺的会补上」

错在把 Sₙ/n → p 读成了 Sₙ − np → 0。第五、六节已经证明后者是假的。

误用二:「大数定律保证长期一定回本」

大数定律确实保证长期结果收敛——但收敛到的是期望值,而不是 0。当单位期望为 R − 1 < 0 时,大数定律保证的恰恰是长期亏损趋于确定。它是反过来用的。见《期望值与返奖率》。

误用三:「n 已经很大了,所以现在的偏差不正常」

要判断一个偏差是否异常,得用统计检验算 p 值,不能凭「n 很大了」这种感觉。按 CLT,n = 10000 时出现 100 次以上的绝对偏差,概率有 4.6%,完全正常。

误用四:把大数定律用在不独立的场合

本文所有推导都用了独立性(第三节里 Var(Sₙ) = np(1−p) 这一步)。若各次试验相关,方差可加就不成立,结论要重新讨论。不过对于合格的摇号装置,独立性正是设计目标。


延伸阅读与参考

  • Feller, W. An Introduction to Probability Theory and Its Applications, Vol. 1 (3rd ed.). 第 8 章「大数定律」,第 3 章关于波动与游程的讨论尤其值得读。
  • Billingsley, P. Probability and Measure (3rd ed.). 第 6 节弱大数定律,第 22 节强大数定律的柯尔莫哥洛夫证明。
  • Durrett, R. Probability: Theory and Examples (5th ed.). 第 2 章各类收敛概念的系统对比。
  • Ross, S. A First Course in Probability (10th ed.). 第 8 章极限定理,含切比雪夫不等式的初等处理。
  • Bernoulli, J. Ars Conjectandi (1713). 弱大数定律的最初来源。