指数函数

形如 f(x) = aˣ 的函数,底数为常数、指数为变量。以 e 为底的指数函数 eˣ 在 AI 中无处不在——Softmax、概率分布、学习率衰减都以它为基础。

核心公式

📖 符号说明

符号含义说明取值范围
底数大于 0 且不等于 1 的常数(0,1)∪(1,+∞)
指数自变量,任意实数(-∞, +∞)
自然常数≈ 2.71828,连续复利极限

一句话理解

指数函数就是"变量在指数位置"的函数——底数不变,指数变化,增长速度越来越快。

公式

f(x)=ax(a>0,  a1)f(x) = a^x \quad (a > 0,\; a \neq 1)f(x)=ax(a>0,a=1)

当底数 a=e2.718a = e \approx 2.718a=e2.718 时,得到最重要的自然指数函数:

f(x)=exf(x) = e^xf(x)=ex

为什么 exe^xex 特殊

所有指数函数中,只有 exe^xex 满足:

ddxex=ex\frac{d}{dx} e^x = e^xdxdex=ex

导数等于自身——"此刻增长的速度,恰好等于此刻的大小"。这个性质让 exe^xex 在微积分中极其好用,也是它在 AI 中被广泛采用的根本原因。

指数增长有多快

对折次数厚度
00.1 mm
10约 10 cm
20约 105 m
42约 44 万 km(超过地月距离)

仅仅 42 次翻倍,0.1mm 的纸就能叠到月球。这就是指数增长的威力。

在 AI 中的应用

  • Softmaxsoftmax(zi)=ezijezj\text{softmax}(z_i) = \frac{e^{z_i}}{\sum_j e^{z_j}}softmax(zi)=jezjezi,用 exe^xex 将分数转为概率
  • 概率分布:正态分布、玻尔兹曼分布的核心都是 ex2e^{-x^2}ex2eE/kTe^{-E/kT}eE/kT
  • 学习率衰减ηt=η0eλt\eta_t = \eta_0 \cdot e^{-\lambda t}ηt=η0eλt,指数衰减让学习率平滑降低
  • 梯度消失/爆炸:深层网络中梯度的连乘本质上是指数行为

与对数的关系

指数函数和对数函数互为反函数:

y=ex    x=lnyy = e^x \iff x = \ln yy=exx=lny

图形上,exe^xexlnx\ln xlnx 关于直线 y=xy = xy=x 镜像对称。