Glossary
术语词库
技术术语速查词库。在文章中遇到术语时,悬停即可看到释义,也可在这里集中浏览。
Negative Sampling
Negative Sampling负采样negative samplingNEGNegative Sampling 是一种训练优化技巧,将对整个词表的 Softmax 计算简化为少量"负样本"的二分类问题,大幅降低 Word2Vec 等模型的训练成本。
→OOV (Out of Vocabulary)
OOVOut of Vocabularyout of vocabulary未登录词OOV 指输入文本中不在模型词表内的词,是 NLP 系统必须处理的边界情况。子词分词(如 BPE)通过拆分未知词为已知片段来缓解此问题。
→Context Window(上下文窗口)
Context Window上下文窗口context window上下文长度模型单次推理能"看到"的最大 token 数量,包括输入(prompt + 历史对话)和输出的总和。GPT-4 Turbo 为 128K tokens,Claude 3 为 200K tokens。窗口越大能处理的上下文越长,但注意力会随 token 增多而稀释。
→Logit(对数几率)
LogitlogitlogitsLogits模型输出层在 Softmax 之前的原始数值,是未经归一化的"对每个候选 token 的打分"。Logit 值越高,对应 token 被选中的概率越大。Temperature、Top-k 等采样策略都作用于 logit 阶段。
→幻觉(Hallucination)
幻觉HallucinationhallucinationAI幻觉LLM 生成看似合理但实际错误或虚构的内容的现象。模型不是"故意撒谎",而是在没有足够依据时仍按概率生成最可能的下一个 token,导致输出与事实不符。是 AI 应用中最核心的可靠性挑战之一。
→GELU(高斯误差线性单元)
GELUgeluGaussian Error Linear UnitGELU激活函数Gaussian Error Linear Unit,一种平滑的非线性激活函数。与 ReLU 的"硬截断"不同,GELU 对负值做概率性保留而非直接归零,输出更平滑。GPT、BERT 等主流 Transformer 模型的 FFN 层默认使用 GELU 替代 ReLU。
→One-hot(独热编码)
one-hotOne-hot独热编码one-hot 编码一种向量编码方式:向量中只有一个位置是 1,其余全是 0。常用于表示分类标签或词表中的 token 位置。例如词表大小 50,000 时,第 3,127 个 token 的 one-hot 向量就是第 3,127 位为 1、其余 49,999 位为 0 的 50,000 维向量。
→权重矩阵(Weight Matrix)
权重矩阵Weight Matrixweight matrix权重参数神经网络中存储可学习参数的矩阵,是模型"知识"的物理载体。输入向量乘以权重矩阵 = 线性变换。训练的本质就是调整权重矩阵中每个数字的值,使模型输出越来越接近期望结果。模型的"参数量"= 所有权重矩阵元素数之和。
→Streaming(流式输出)
Streaming流式输出streaming流式响应LLM 逐 token 返回生成结果的输出模式,而非等全部生成完毕后一次性返回。技术上通常基于 SSE(Server-Sent Events)实现。这不是 API 的优化技巧,而是 Transformer 自回归生成机制的直接映射——模型每次只预测一个 token。
→Test-time Compute(推理时间计算)
Test-time Compute推理时间计算test-time computeinference-time compute通过在推理阶段投入更多计算资源来提升模型性能的策略。与训练阶段的 Scaling Law(堆参数+数据)不同,test-time compute 在不改变模型权重的前提下,用更多推理步骤换取更好的结果。代表:DeepSeek-R1、OpenAI o1。
→对齐税(Alignment Tax)
对齐税Alignment Taxalignment tax对齐代价同一模型经过对齐训练(RLHF/DPO)后,在标准 NLP 基准测试上出现的性能回退。本质是对齐优化了"行为模式"(听话、安全),但可能以牺牲部分原始能力为代价。InstructGPT 论文提出 PPO-ptx 混合训练来缓解此问题。
→Prefill / Decode(预填充 / 解码)
PrefillPrefill/Decode预填充Prefill 阶段LLM 推理的两个阶段:Prefill 阶段一次性处理整个输入 prompt(计算密集,可并行),Decode 阶段逐 token 生成输出(内存密集,串行)。两阶段的瓶颈不同,优化策略也不同。
→