把硬币掷十次,出现七次正面并不算罕见。可是把同一枚硬币掷一万次,正面朝上的比例就会神奇地接近一半。每一次的结果都完全无法预测,但汇集得足够多时,结果却稳定得惊人。解释这一现象的原理,正是“大数定律(Law of Large Numbers)”。
简单来说,大数定律是概率论的一条基本定理:在相同条件下,相互独立的试验重复得越多,实际观察到的平均值或比例就越接近理论上的期望值。雅各布·伯努利最早证明了它(成果于1713年发表),并称之为“黄金定理”。如今,从保险费的计算到民意调查、赌场经营,几乎所有用数字处理风险的领域都以它为支撑。
本文将从大数定律的含义与基本原理讲起,介绍这一定律形成的历史、人们常陷入的误解,以及它在实际生活中的应用案例,力求通俗易懂。
大数定律的原理与应用
什么是大数定律?

掷一次骰子,无法知道会出现1到6中的哪个点数。但从理论上说,骰子点数的平均值,也就是期望值,是(1+2+3+4+5+6) ÷ 6 = 3.5。最初几次的平均值可能是2,也可能是5,但掷到几百次、几千次时,点数的平均值就会稳定在3.5附近。
(1)样本平均值与期望值
实际观察到的数值的平均值称为样本平均值。大数定律指出,随着试验次数n增大,样本平均值大幅偏离期望值的概率会趋近于0。
(2)两种形式
在数学上,这一定律按强度分为两种来说明。
- 弱大数定律(Weak Law of Large Numbers):只要试验次数足够多,样本平均值落在期望值附近的概率就趋近于1。
- 强大数定律(Strong Law of Large Numbers):如果试验无限地进行下去,样本平均值几乎必然收敛于期望值,这是更强的结论。
大数定律是如何诞生的?

人们很早就凭经验知道,做得多了,结果就会趋于均匀。最早用数学证明这一直觉的,是瑞士数学家雅各布·伯努利。
(1)伯努利的黄金定理
伯努利研究这个问题大约20年,其成果在他去世后的1713年收录于《猜度术》(Ars Conjectandi)一书出版。他对这一成果非常自豪,甚至称之为“黄金定理”。
(2)为它命名的泊松
“大数定律”这一名称,是法国数学家西莫恩·德尼·泊松于1837年最早使用的。此后,切比雪夫在1846年给出了严格的证明;进入20世纪,博雷尔和柯尔莫哥洛夫完善了强大数定律,使其成为现代概率论的支柱。
关于大数定律的常见误解

大数定律常常被误读,最典型的例子就是赌徒谬误。
(1)赌徒谬误
1913年8月,摩纳哥蒙特卡洛赌场的轮盘上曾连续26次开出黑色。人们认为现在该轮到红色了,于是越押越多,结果输掉了大笔钱。但轮盘上的球并不记得之前的结果,所以每一次开出红色的概率都没有改变。
(2)不是被填补,而是被稀释
大数定律并不意味着前面偏多的结果会在后面被“补偿”回来。试验次数增多后,最初的偏差只是被大量新结果稀释,比例才逐渐接近期望值。因此,正面和反面出现次数的差值本身反而可能变大。
(3)小数定律
心理学家特沃斯基和卡尼曼把人们只看寥寥几次结果就认为能代表整体的倾向,讽刺地称为“小数定律”。根据少量案例草率下结论,等于把大数定律反过来用。
大数定律用在哪里?

大数定律让对个人来说无法预测的事情,在整个群体层面变得可以计算。正因如此,许多用数字管理不确定风险的制度才得以实现。
- 保险(Insurance):无法知道某个人何时会遭遇事故,但投保人一多,事故总数就变得可以预测,从而能够确定合理的保险费。
- 民意调查(Opinion Poll):随机抽取的样本越大,样本的支持率就越接近全体国民的实际支持率。
- 赌场(Casino):单局中顾客也许能赢,但局数累积得足够多时,对赌场有利的期望值就会原原本本地体现为收益。
- 蒙特卡洛模拟(Monte Carlo Simulation):用计算机无数次重复随机实验,以估算复杂问题答案的计算方法。
不过,这一定律要成立,各次试验必须相互独立、条件相同,样本也不能偏向一方。如果数据是以有偏差的方式收集的,无论收集多少,也只会趋近一个错误的数值。
大数定律告诉我们,即使在充满偶然的世界里,也隐藏着秩序。与其为一次的结果或喜或忧,不如学会看清经验积累到足够多时显现出来的趋势。
不凭少量案例匆忙下判断的态度,这正是正确统计思维的第一步。