基础← 返回知识库
方差
每个数据跟均值的差的平方,再求平均——用一个数字量化数据"散得多开"。方差越大,数据越分散;方差为零,所有数据完全相同。
核心公式
📖 符号说明
| 符号 | 含义 | 说明 | 取值范围 |
|---|---|---|---|
| 方差 | 数据散度的度量 | [0, +∞) | |
| 第 i 个数据 | 数据集中的每一个值 | — | |
| 均值 | 数据的中心位置 | — | |
| 数据个数 | 一共有多少个数据 | — |
🔢 分步计算
- 1
每个数据跟均值的差
- 2
平方消负号,让所有差都变成正数
- 3
平方差求平均,得到方差
前置知识
直觉理解
两组同学的考试成绩均值都是 75 分:
- 二班:70, 73, 75, 77, 80——大家都在 75 附近
- 三班:50, 60, 75, 90, 100——从 50 到 100 散得到处都是
均值一样,但"散"的程度天差地别。怎么用一个数字量化这种差别?
发现过程
第一步:算每人跟均值的差。 二班:−5,−2,0,+2,+5。加起来?=0——正负相消了,行不通。
第二步:平方消负号。 25,4,0,4,25。再求平均:
σ2=525+4+0+4+25=558=11.6这个"平方差的平均值"就是方差。
数学定义
σ2=n1i=1∑n(xi−xˉ)2xi 是第 i 个数据,xˉ 是均值,(xi−xˉ)2 是"跟均值的差的平方"。
对比
二班方差 11.6,三班方差 340——差了近 30 倍,精确反映了"三班比二班散得多"。
方差越大 → 数据越分散;方差为零 → 所有数据完全相同。
这在机器学习中用来做什么
方差衡量数据的"分散程度"——训练神经网络时,Batch Normalization 会计算每批数据的方差,然后将数据标准化(方差归一),让模型训练更稳定。
引用本概念的文章