Glossary
术语词库
技术术语速查词库。在文章中遇到术语时,悬停即可看到释义,也可在这里集中浏览。
Top-p 采样(Nucleus Sampling)
Top-pTop-p 采样top-pNucleus Sampling解码策略:将 token 按概率从高到低排序,选取累积概率刚超过阈值 p 的最小集合,在其中采样。比 Top-k 更自适应——分布集中时候选少,分散时候选多。
→Top-k 采样
Top-kTop-k 采样top-kTop-k sampling解码策略:每步只从概率最高的 k 个 token 中采样,忽略其余所有候选。k 越小越保守(k=1 等价于贪心解码),k 越大越多样。
→Temperature(采样温度)
Temperature采样温度temperature温度参数控制模型输出随机性的参数。Temperature 越高,概率分布越平坦(更随机、更有创意);越低,分布越尖锐(更确定、更保守)。通过在 Softmax 前将 logits 除以 T 值实现。
→自回归(Autoregressive)
自回归Autoregressiveautoregressive自回归模型逐步生成序列的范式:每一步基于已生成的所有前缀预测下一个元素。GPT 就是自回归语言模型——逐 token 生成,每次只看"左边"已有的内容,通过 Causal Mask 保证不偷看未来。
→Causal Mask(因果掩码)
Causal Mask因果掩码causal mask因果注意力掩码自回归模型中用于防止 token "看到未来"的掩码矩阵。在 Softmax 前将注意力分数矩阵的上三角设为 -∞,确保每个位置只能关注自身及之前的 token。
→Tokenizer(分词器)
Tokenizer分词器tokenizerTokeniser将原始文本转换为 token ID 序列(编码)并将 token ID 还原为文本(解码)的组件。每个语言模型都绑定一个训练好的 Tokenizer,其词表和合并规则决定了模型的输入粒度。
→BPE(字节对编码)
BPEByte Pair Encoding字节对编码Byte-Pair Encoding一种子词分词算法:从单字符出发,反复合并语料中出现频率最高的相邻字符对,直到达到目标词表大小。GPT 系列 Tokenizer 均基于 BPE 及其变体。
→Vercel AI SDK
Vercel AI SDKAI SDKVercel 开源的 TypeScript AI 工具库,提供 streamText、tool()、useChat 等 API,让前端/全栈开发者快速集成 LLM 对话、Function Calling、流式响应等能力。支持 OpenAI、Anthropic、Google 等多家模型提供商。
→AutoGen
AutoGenautogenAuto GenMicrosoft Research 于 2023 年开源的多 Agent 对话框架,支持多个 Agent 通过自然语言对话协作完成任务,提供全自主和人机协作两种模式。ICLR 2024 发表。
→Multi-Agent(多智能体编排)
Multi-Agent多 Agent多智能体多Agent编排多个专业化 AI Agent 协同完成复杂任务的架构模式。核心问题:分工(谁干什么)、通信(怎么传递信息)、协调(谁说了算)。主流模式包括顺序管道、监督者、群聊三种。
→CrewAI
CrewAIcrewaiCrew AI2023 年底开源的高级多 Agent 编排框架,通过定义 Agent(角色+目标+工具)、Task(任务)和 Crew(团队)三层抽象快速搭建多智能体协作系统,约定优于配置。
→LangGraph
LangGraphlanggraphLang GraphLangChain 团队于 2024 年初推出的多 Agent 编排框架,基于图结构定义节点(Agent)、边(转移条件)和共享状态,提供底层原语让开发者灵活组装 Agent 工作流。
→