Glossary
术语词库
技术术语速查词库。在文章中遇到术语时,悬停即可看到释义,也可在这里集中浏览。
Function Calling(函数调用)
Function Calling函数调用function callingFCLLM API 层面的能力机制——模型在对话中输出结构化 JSON,声明「需要调用哪个函数、传什么参数」。模型只负责意图声明,实际执行由外部代码完成。类比:Function Calling 是「拨电话号码」,而 Tool Use 是「整个电话系统」——FC 只是 Tool Use 完整链路中的一个环节,不是同义词。
→DPO(直接偏好优化)
DPO直接偏好优化Direct Preference Optimizationdirect preference optimization跳过Reward Model阶段,直接用人类偏好数据优化语言模型的对齐方法。相比RLHF的三阶段流程更简洁稳定,Claude和LLaMA 2等模型采用了DPO或其变体。
→PPO(近端策略优化)
PPO近端策略优化Proximal Policy Optimizationproximal policy optimizationOpenAI提出的强化学习算法,RLHF三阶段的最后一步。用Reward Model的评分作为奖励信号优化语言模型,同时用KL散度惩罚防止模型偏离预训练能力太远。
→SFT(监督微调)
SFT监督微调Supervised Fine-Tuning有监督微调RLHF三阶段的第一步:用人工标注的高质量问答对微调预训练模型,教会模型"对话的格式和基本礼仪"。数据量不大(几千到几万条)但质量要求极高。
→Few-shot / Zero-shot(少样本/零样本学习)
Few-shotZero-shot少样本学习零样本学习大模型无需微调,仅通过提示中的少量示例(Few-shot)或纯指令(Zero-shot)即可完成新任务的能力。GPT-3首次大规模展示了这种"涌现能力",是Scaling Law的关键验证。
→Alignment(AI 对齐)
Alignment对齐AI对齐AI Alignment让AI系统的行为符合人类意图和价值观的研究方向。核心问题:预训练目标(预测下一个token)≠ 用户真实需求。RLHF是当前最主流的对齐技术路线。
→RLHF(人类反馈强化学习)
RLHF人类反馈强化学习Reinforcement Learning from Human Feedback基于人类反馈的强化学习通过人类偏好反馈训练AI的三阶段方法:SFT教格式、Reward Model建裁判、PPO优化策略。ChatGPT的核心训练方法,让1.3B参数的InstructGPT在人类评估中碾压175B的GPT-3。
→梯度消失(Vanishing Gradient)
梯度消失Vanishing Gradient梯度消失问题gradient vanishing深层网络训练时梯度在反向传播过程中逐层衰减趋近于零的现象。导致底层参数几乎无法更新,网络"学不动"。残差连接和归一化是主要解决方案。
→标量(Scalar)
标量Scalarscalar纯量只有大小、没有方向的单个数值。与向量相对——向量有大小和方向,标量只是一个数。温度、长度、点积的结果都是标量。
→FFN(前馈网络)
FFN前馈网络Feed-Forward Network前馈神经网络Transformer中每个Block内的两层全连接网络,对每个token独立做非线性变换。如果说注意力层负责token间的"信息交换",FFN就负责每个token自身的"信息加工",两者分工互补。
→LayerNorm(层归一化)
LayerNormLayer Normalization层归一化layer norm一种归一化技术,对单个样本的特征维度做标准化(均值为0、方差为1),再通过可学习参数缩放和平移。在Transformer中紧跟每个子层之后,稳定训练过程,加速收敛。
→残差连接(Residual Connection)
残差连接Residual ConnectionSkip Connection跳跃连接将子层的输入直接加到其输出上(output = sublayer(x) + x),使梯度可以绕过子层直接回传。这个设计让Transformer能堆叠数十甚至上百层而不发生梯度消失,是深层网络训练的关键技术。
→