Chain-of-Thought(思维链)
让 LLM 在给出最终答案前,先逐步展示推理过程的提示策略。通过"让我一步步想"引导模型输出中间推理步骤,显著提升复杂推理任务的准确率。与 ReAct 的区别:CoT 是"闭卷思考"(纯推理),ReAct 是"开卷考试"(推理+行动交替)。
Chain-of-Thought(思维链)
一句话理解
让模型"把草稿纸展开"——不是直接给答案,而是先展示推理过程,再得出结论。
核心思想
Wei et al. (2022) 发现,在 Prompt 中加入"Let's think step by step"或提供带推理步骤的 Few-shot 示例,能显著提升 LLM 在数学、逻辑、常识推理任务上的准确率。
本质上是利用 LLM 的自回归特性——前面生成的推理步骤会成为后续推理的上下文,相当于给模型提供了"工作记忆"。
变体
| 变体 | 特点 | 适用场景 |
|---|---|---|
| Zero-shot CoT | 只加一句"Let's think step by step" | 通用推理任务 |
| Few-shot CoT | 提供带推理步骤的示例 | 特定领域推理 |
| Tree-of-Thought (ToT) | 多条推理路径并行探索,选择最优 | 需要回溯的复杂问题 |
CoT vs ReAct
| Chain-of-Thought | ReAct | |
|---|---|---|
| 方式 | 纯推理(闭卷) | 推理 + 行动(开卷) |
| 外部信息 | 不能获取 | 可以调用工具 |
| 适用场景 | 数学推理、逻辑题 | 需要外部信息的多步任务 |
在 Agent 系统中,CoT 和 ReAct 不是互斥的——ReAct 循环中的每个 Thought 步骤本身就可以使用 CoT 策略来提升推理质量。
引用本术语的文章