进阶← 返回知识库
中心极限定理
大量独立随机变量的平均值趋向正态分布,无论原始分布是什么形状。这解释了为什么正态分布在自然界和 AI 中无处不在——只要是多个因素叠加的结果,就会趋向钟形曲线。
核心公式
📖 符号说明
| 符号 | 含义 | 说明 | 取值范围 |
|---|---|---|---|
| N 个随机变量的平均值 | — | — | |
| 原始分布的均值 | — | — | |
| 原始分布的方差 | 必须有限 | (0, +∞) | |
| 样本数 | 越大越接近正态 | 正整数 |
一句话理解
把很多随机的东西加起来取平均,不管每个东西原来长什么样,平均值的分布都会变成钟形曲线。
公式表述
设 X1,X2,…,XN 是 N 个独立同分布的随机变量,均值为 μ,方差为 σ2。则当 N 足够大时:
XˉN=N1i=1∑NXidN(μ,Nσ2)平均值的分布趋向正态分布,且标准差以 N1 的速度缩小。
骰子实验直觉
| 掷骰子个数 N | 平均值分布形状 | 标准差 |
|---|---|---|
| 1 | 均匀分布(6根等高柱子) | 1.708 |
| 5 | 开始像钟形 | 0.764 |
| 30 | 明显的钟形 | 0.312 |
| 100 | 几乎完美的钟形 | 0.171 |
单个骰子是均匀分布——六面等概率。但取 100 个骰子的平均值,重复 5000 次,直方图就是一条漂亮的钟形曲线,中心在 3.5。
为什么重要
CLT 回答了一个根本问题:为什么正态分布无处不在?
只要一个结果是许多独立小因素叠加的产物,它就趋向正态分布:
- 身高 = 数百个基因 + 营养 + 环境 → 正态分布
- 测量误差 = 多个微小干扰累加 → 正态分布
- 大模型某层的输出 = 数千个权重和输入的加权和 → 趋向正态分布
NOTE
CLT 的条件 CLT 需要:① 随机变量相互独立;② 每个变量的方差有限。极端的重尾分布(如柯西分布)不满足条件②,不适用 CLT。
在 AI 中的应用
- 权重初始化的理论基础:Xavier/He 初始化假设层输出近似正态,这个假设的合理性来自 CLT——输出是大量权重乘输入的求和
- Batch Normalization:将每层激活标准化为近似 N(0,1),利用了 CLT 保证的近似正态性
- 统计检验:大样本下,样本均值近似正态,这让置信区间和假设检验成为可能
- 蒙特卡洛方法:采样估计的精度以 N1 收敛,这直接来自 CLT