Chain-of-Thought(思维链)
让 LLM 在给出最终答案前,先逐步展示推理过程的提示策略。通过"让我一步步想"引导模型输出中间推理步骤,显著提升复杂推理任务的准确率。与 ReAct 的区别:CoT 是"闭卷思考"(纯推理),ReAct 是"开卷考试"(推理+行动交替)。
Chain-of-Thought(思维链)
一句话理解
让模型"把草稿纸展开"——不是直接给答案,而是先展示推理过程,再得出结论。
核心思想
Wei et al. (2022) 发现,在 Prompt 中加入"Let's think step by step"或提供带推理步骤的 Few-shot 示例,能显著提升 LLM 在数学、逻辑、常识推理任务上的准确率。
本质上是利用 LLM 的自回归特性——前面生成的推理步骤会成为后续推理的上下文,相当于给模型提供了"工作记忆"。
变体
CoT vs ReAct
在 Agent 系统中,CoT 和 ReAct 不是互斥的——ReAct 循环中的每个 Thought 步骤本身就可以使用 CoT 策略来提升推理质量。