中心极限定理

大量独立随机变量的平均值趋向正态分布,无论原始分布是什么形状。这解释了为什么正态分布在自然界和 AI 中无处不在——只要是多个因素叠加的结果,就会趋向钟形曲线。

核心公式

📖 符号说明

符号含义说明取值范围
N 个随机变量的平均值
原始分布的均值
原始分布的方差必须有限(0, +∞)
样本数越大越接近正态正整数

一句话理解

把很多随机的东西加起来取平均,不管每个东西原来长什么样,平均值的分布都会变成钟形曲线。

公式表述

X1,X2,,XNX_1, X_2, \ldots, X_NX1,X2,,XNNNN 个独立同分布的随机变量,均值为 μ\muμ,方差为 σ2\sigma^2σ2。则当 NNN 足够大时:

XˉN=1Ni=1NXi  d  N(μ,σ2N)\bar{X}_N = \frac{1}{N}\sum_{i=1}^{N} X_i \;\xrightarrow{d}\; \mathcal{N}\left(\mu, \frac{\sigma^2}{N}\right)XˉN=N1i=1NXidN(μ,Nσ2)

平均值的分布趋向正态分布,且标准差以 1N\frac{1}{\sqrt{N}}N1 的速度缩小。

骰子实验直觉

掷骰子个数 N平均值分布形状标准差
1均匀分布(6根等高柱子)1.708
5开始像钟形0.764
30明显的钟形0.312
100几乎完美的钟形0.171

单个骰子是均匀分布——六面等概率。但取 100 个骰子的平均值,重复 5000 次,直方图就是一条漂亮的钟形曲线,中心在 3.5。

为什么重要

CLT 回答了一个根本问题:为什么正态分布无处不在?

只要一个结果是许多独立小因素叠加的产物,它就趋向正态分布:

  • 身高 = 数百个基因 + 营养 + 环境 → 正态分布
  • 测量误差 = 多个微小干扰累加 → 正态分布
  • 大模型某层的输出 = 数千个权重和输入的加权和 → 趋向正态分布

NOTE

CLT 的条件 CLT 需要:① 随机变量相互独立;② 每个变量的方差有限。极端的重尾分布(如柯西分布)不满足条件②,不适用 CLT。

在 AI 中的应用

  • 权重初始化的理论基础:Xavier/He 初始化假设层输出近似正态,这个假设的合理性来自 CLT——输出是大量权重乘输入的求和
  • Batch Normalization:将每层激活标准化为近似 N(0,1)\mathcal{N}(0,1)N(0,1),利用了 CLT 保证的近似正态性
  • 统计检验:大样本下,样本均值近似正态,这让置信区间和假设检验成为可能
  • 蒙特卡洛方法:采样估计的精度以 1N\frac{1}{\sqrt{N}}N1 收敛,这直接来自 CLT