数学知识库

数学知识库

可交互的数学概念可视化,从入门到专家,逐个公式拆解与图解。

进阶

贝叶斯公式

把"已知原因求结果"的概率翻转成"已知结果推原因"的概率。核心思路:先有一个初始判断(先验),看到新证据后按规则更新成新的判断(后验),分母是所有能产生该证据的情况之和。

进阶

欧拉公式

连接指数函数与三角函数的公式 e^(iθ)=cosθ+i·sinθ,被誉为"最美数学公式",是复数分析和信号处理的基石

进阶

中心极限定理

大量独立随机变量的平均值趋向正态分布,无论原始分布是什么形状。这解释了为什么正态分布在自然界和 AI 中无处不在——只要是多个因素叠加的结果,就会趋向钟形曲线。

进阶

正态分布

中间高两头低的钟形曲线。均值决定钟的位置,标准差决定钟的胖瘦。最实用的规律:约 68% 的数据在均值 ±1 个标准差内,约 95% 在 ±2 个标准差内。

进阶

反向传播(Backpropagation)

从损失出发沿计算图逆行,用链式法则把路径上的偏导数逐段相乘,算出每个权重的梯度。路径上有 ReLU 关闭的节点时,梯度信号被截断为零。对应代码中的 loss.backward()。

进阶

梯度(Gradient)

函数在某点的坡度——一维就是导数,多维就是把每个方向的偏导数打包成一个向量。梯度指向函数值增长最快的方向,所以朝它的反方向走就是在下山。

进阶

KV Cache(键值缓存)

Transformer 推理优化:缓存已计算的 Key 和 Value 矩阵,生成新 token 时只算增量并拼接,避免重复计算历史 token。将每步注意力计算复杂度从 O(n²) 降到 O(n)。

进阶

梯度下降(Gradient Descent)

蒙眼下山的过程——先用损失函数知道自己有多高,再用梯度感受坡度方向,乘以学习率决定步幅,然后反复执行直到走到谷底。

进阶Live Demo

Self-Attention(自注意力机制)

Transformer的核心机制。序列中的每个token通过Q/K/V三组投影计算与所有其他token的关联权重,再用权重加权求和得到新的表示。让任意两个位置之间的信息传递距离变为O(1)。

进阶Live Demo

Multi-Head Attention(多头注意力)

将Q/K/V各拆分为多组(如8组),每组独立计算注意力后拼接。不同的"头"关注不同维度的关系模式(语法、语义、指代等),总计算量与单头相当但信息捕获能力更强。