均方误差(MSE)

所有预测误差的平方取平均——沿用"平方消负号"的思路,推广到多个输出。值越小说明预测越准。回归任务的首选损失函数,分类任务通常用交叉熵替代。

核心公式

📖 符号说明

符号含义说明取值范围
损失值均方误差[0, +∞)
第 i 个预测值模型输出
第 i 个真实值标签
输出个数预测维度

前置知识

一句话版本

把每个预测值和真实值的差平方后,全部加起来取平均——就是均方误差。

公式

L=1ni=1n(piyi)2L = \frac{1}{n}\sum_{i=1}^{n}(p_i - y_i)^2L=n1i=1n(piyi)2

每一项 (piyi)2(p_i - y_i)^2(piyi)2 是单个输出的平方误差,求和后除以 nnn 取平均。

直觉理解

还记得损失函数里"平方消负号"的思路吗?MSE 就是把它推广到多个输出:

  • 每个输出算一次平方误差
  • 全部加起来取平均

用一个网络输出 (0.73,0.5)(0.73, 0.5)(0.73,0.5) 对比真实标签 (1,0)(1, 0)(1,0)

  • 第 1 个输出:(0.731)2=0.073(0.73 - 1)^2 = 0.073(0.731)2=0.073
  • 第 2 个输出:(0.50)2=0.25(0.5 - 0)^2 = 0.25(0.50)2=0.25
  • 取平均:12(0.073+0.25)=0.161\frac{1}{2}(0.073 + 0.25) = 0.16121(0.073+0.25)=0.161

MSE 的短板

MSE 对所有大小的错误"一视同仁"——预测 0.01(自信地猜错)和预测 0.49(犹豫地猜错),MSE 只差约 4 倍。在分类任务中,我们更希望"自信地猜错"受到严厉惩罚,这正是交叉熵做得更好的地方。

适用场景

  • 回归任务(预测连续数值:房价、温度、距离):MSE 是首选
  • 分类任务(预测概率):通常用交叉熵替代