Chain-of-Thought(思维链)

让 LLM 在给出最终答案前,先逐步展示推理过程的提示策略。通过"让我一步步想"引导模型输出中间推理步骤,显著提升复杂推理任务的准确率。与 ReAct 的区别:CoT 是"闭卷思考"(纯推理),ReAct 是"开卷考试"(推理+行动交替)。

Chain-of-Thought(思维链)

一句话理解

让模型"把草稿纸展开"——不是直接给答案,而是先展示推理过程,再得出结论。

核心思想

Wei et al. (2022) 发现,在 Prompt 中加入"Let's think step by step"或提供带推理步骤的 Few-shot 示例,能显著提升 LLM 在数学、逻辑、常识推理任务上的准确率。

本质上是利用 LLM 的自回归特性——前面生成的推理步骤会成为后续推理的上下文,相当于给模型提供了"工作记忆"。

变体

变体特点适用场景
Zero-shot CoT只加一句"Let's think step by step"通用推理任务
Few-shot CoT提供带推理步骤的示例特定领域推理
Tree-of-Thought (ToT)多条推理路径并行探索,选择最优需要回溯的复杂问题

CoT vs ReAct

Chain-of-ThoughtReAct
方式纯推理(闭卷)推理 + 行动(开卷)
外部信息不能获取可以调用工具
适用场景数学推理、逻辑题需要外部信息的多步任务

在 Agent 系统中,CoT 和 ReAct 不是互斥的——ReAct 循环中的每个 Thought 步骤本身就可以使用 CoT 策略来提升推理质量。

引用本术语的文章