Chain-of-Thought(思维链)
让LLM在回答前先展示逐步推理过程的提示技术。通过"让我一步步思考"引导模型输出中间推理步骤,显著提升复杂推理任务的准确率。Wei et al. 2022年提出。
Chain-of-Thought(思维链)
一句话理解
让模型"说出思考过程"而不是直接给答案——就像考试时要求写解题步骤,而不只是填最终结果。
核心思想
传统 prompt 让模型直接输出答案,复杂问题容易出错。Chain-of-Thought(CoT)通过在 prompt 中引导模型输出中间推理步骤,让模型"慢下来想清楚",显著提升数学推理、逻辑推理等复杂任务的准确率。
最简单的触发方式就是在 prompt 末尾加一句:
"Let's think step by step."
两种形式
Few-shot CoT
在 prompt 中给出带推理步骤的示例,模型模仿示例格式输出推理链。
Zero-shot CoT
不给示例,仅用"Let's think step by step"引导模型自发输出推理过程。
与 ReAct 的区别
Chain-of-Thought 是纯推理——模型只能用自己"脑子里"的知识思考,无法获取外部信息。ReAct 在 CoT 的基础上加入了行动能力,模型可以在推理过程中调用工具获取新信息。
类比:CoT 是闭卷考试(靠记忆推理),ReAct 是开卷考试(可以查资料)。
与推理模型的关系
GPT-o1、DeepSeek-R1 等"推理模型"本质上是把 CoT 从 prompt 工程升级为模型内化能力——模型在训练阶段就学会了自动展开推理链,不需要用户手动引导。这些模型的 thinking tokens 就是内化的 Chain-of-Thought。