随机变量

用数字表示随机实验结果的变量。掷骰子的点数、明天的气温、模型预测的下一个词——都是随机变量。离散型取有限个值,连续型取一个区间内的任意值。

核心公式

📖 符号说明

符号含义说明
随机变量用大写字母表示
取值随机变量的具体值,用小写
样本空间所有可能结果的集合

一句话理解

随机变量就是"还没确定结果的数字"——你知道它可能是什么,但不知道这次具体是几。

定义

随机变量是一个从随机实验的结果到实数的映射。记作大写字母 XXX,具体取到的值记作小写 xxx

X:ΩRX: \Omega \to \mathbb{R}X:ΩR

两种类型

类型取值例子用什么描述概率
离散型有限或可数个值骰子点数 {1,2,3,4,5,6}概率质量函数 PMF:P(X=x)P(X=x)P(X=x)
连续型一个区间内任意值身高、温度、模型输出的 logit概率密度函数 PDF:f(x)f(x)f(x)

NOTE

离散 vs 连续的关键区别 离散型可以问"X 恰好等于 3 的概率是多少"(答案非零)。 连续型不能这样问——"身高恰好等于 170.000...cm"的概率是 0。连续型只能问"X 落在某个区间内的概率"。

在 AI 中的应用

  • 语言模型的输出:下一个 token 是离散随机变量,取值为词表中的每个词
  • Embedding 的各维度:连续随机变量,训练时不断更新
  • 损失函数的值:每个 batch 算出的 loss 是随机变量(取决于随机抽样的数据)
  • 权重初始化WN(0,σ2)W \sim \mathcal{N}(0, \sigma^2)WN(0,σ2),权重是从正态分布中采样的随机变量