数学知识库
数学知识库
可交互的数学概念可视化,从入门到专家,逐个公式拆解与图解。
正则化
在损失函数后面加一项惩罚,让权重不能太大——相当于"答案越长扣分越多",迫使模型只保留真正有用的规律,防止过拟合。
均方误差(MSE)
所有预测误差的平方取平均——沿用"平方消负号"的思路,推广到多个输出。值越小说明预测越准。回归任务的首选损失函数,分类任务通常用交叉熵替代。
标准差
方差开根号——把"散度"的单位从"平方"还原回原始数据的单位。标准差越大,数据散得越开;可以直接跟原始数据比大小,比方差更直观。
均值
把所有数据加起来除以个数——如果每个人"水平完全一样",每人该分到多少。一个数字概括一群数据的"中心位置"。
贝叶斯公式
把"已知原因求结果"的概率翻转成"已知结果推原因"的概率。核心思路:先有一个初始判断(先验),看到新证据后按规则更新成新的判断(后验),分母是所有能产生该证据的情况之和。
后验概率
看到新证据后,更新过的概率。先验是起点,证据是新信息,后验是更新后的判断——从"0.1% 会得病"变成"检测阳性后约 9% 得病"。"后验"就是"在证据之后"。
先验概率
在看到任何新证据之前,对一件事的初始判断。"先验"就是"在证据之前"——只凭背景知识(比如发病率)做出的概率估计,是贝叶斯更新的起点。
概率
一件事发生的可能性有多大,用 0 到 1 之间的数表示——0 是不可能,1 是必然。在所有结果等可能时,概率 = 我关心的结果数 ÷ 全部结果数。
线性变换(Linear Transformation)
用矩阵把向量映射到新向量的操作,需同时满足两个条件:直线变完还是直线,且原点不动。平移动了原点不算,鱼眼让直线变弯也不算。
转置(Transpose)
把矩阵的行和列对调——原来第 $i$ 行第 $j$ 列的元素,变成第 $j$ 行第 $i$ 列。$m \times n$ 矩阵转置后变成 $n \times m$。记号是右上角加一个 T:$A^T$。
矩阵(Matrix)
把一组数字排成若干行、若干列的矩形阵列。一个 $m \times n$ 矩阵有 $m$ 行 $n$ 列。一行数据就是一个行向量,一列数据就是一个列向量——向量是"只有一行或一列的矩阵"。
偏导数(Partial Derivative)
多变量函数中,固定其他变量不动、只对一个变量求导得到的变化率。符号 ∂ 替代 d,提醒"还有变量被固定住了"。