Test-time Compute(推理时间计算)

通过在推理阶段投入更多计算资源来提升模型性能的策略。与训练阶段的 Scaling Law(堆参数+数据)不同,test-time compute 在不改变模型权重的前提下,用更多推理步骤换取更好的结果。代表:DeepSeek-R1、OpenAI o1。

Test-time Compute(推理时间计算)

一句话理解

不改模型权重,只在推理时"多想一会儿"——用更多的计算步骤换取更好的回答质量。

核心思想

传统提升模型能力的路径是 Scaling Law:训练时投入更多参数和数据,模型整体变强。但这条路的边际收益在递减——参数从 70B 翻到 700B,性能提升可能只有几个百分点。

Test-time compute 开辟了第二条路:模型本身不变,但在回答问题时花更多的计算来"思考"。就像考试时同一个学生,给他 10 分钟和给他 2 小时,答题质量可能天差地别。

主要实现方式

1. Chain-of-Thought 推理链

让模型输出中间推理步骤,而非直接给答案。更长的推理链 = 更多的 forward pass = 更多的 test-time compute。

2. 多次采样 + 投票(Majority Voting)

同一个问题采样 N 次,取多数一致的答案。N 越大计算量越大,但正确率通常随之提升。

在推理过程中展开多个分支,评估每个分支的质量,选择最优路径。类似于下棋时的"看几步"。

4. 强化学习激发内生推理(DeepSeek-R1 路线)

通过 RL 训练让模型自动学会在推理时展开长思维链,而不依赖人工设计的 CoT 提示。DeepSeek-R1 证明了纯 RL(不需要 CoT 蒸馏数据)就能激发模型的推理能力——这是 test-time compute 从"提示工程"升级为"模型内生能力"的关键突破。

与训练时计算的关系

维度训练时计算(Scaling Law)推理时计算(Test-time Compute)
何时投入训练阶段推理阶段
改变什么模型权重推理过程
扩展方式更多参数 + 数据更多推理步骤
代表GPT-4(参数规模)DeepSeek-R1、OpenAI o1(推理深度)
边际收益递减(Chinchilla 边界)仍在快速增长阶段

为什么重要

2024-2025 年,test-time compute 成为模型能力提升的新前沿。它表明:智能不仅取决于你知道多少(参数),还取决于你愿意想多久(推理步骤)。这对模型的使用方式有直接影响——同一个模型,允许它"思考"更久,就能解决更难的问题。