Test-time Compute(推理时间计算)
通过在推理阶段投入更多计算资源来提升模型性能的策略。与训练阶段的 Scaling Law(堆参数+数据)不同,test-time compute 在不改变模型权重的前提下,用更多推理步骤换取更好的结果。代表:DeepSeek-R1、OpenAI o1。
Test-time Compute(推理时间计算)
一句话理解
不改模型权重,只在推理时"多想一会儿"——用更多的计算步骤换取更好的回答质量。
核心思想
传统提升模型能力的路径是 Scaling Law:训练时投入更多参数和数据,模型整体变强。但这条路的边际收益在递减——参数从 70B 翻到 700B,性能提升可能只有几个百分点。
Test-time compute 开辟了第二条路:模型本身不变,但在回答问题时花更多的计算来"思考"。就像考试时同一个学生,给他 10 分钟和给他 2 小时,答题质量可能天差地别。
主要实现方式
1. Chain-of-Thought 推理链
让模型输出中间推理步骤,而非直接给答案。更长的推理链 = 更多的 forward pass = 更多的 test-time compute。
2. 多次采样 + 投票(Majority Voting)
同一个问题采样 N 次,取多数一致的答案。N 越大计算量越大,但正确率通常随之提升。
3. 树搜索(Tree Search)
在推理过程中展开多个分支,评估每个分支的质量,选择最优路径。类似于下棋时的"看几步"。
4. 强化学习激发内生推理(DeepSeek-R1 路线)
通过 RL 训练让模型自动学会在推理时展开长思维链,而不依赖人工设计的 CoT 提示。DeepSeek-R1 证明了纯 RL(不需要 CoT 蒸馏数据)就能激发模型的推理能力——这是 test-time compute 从"提示工程"升级为"模型内生能力"的关键突破。
与训练时计算的关系
| 维度 | 训练时计算(Scaling Law) | 推理时计算(Test-time Compute) |
|---|---|---|
| 何时投入 | 训练阶段 | 推理阶段 |
| 改变什么 | 模型权重 | 推理过程 |
| 扩展方式 | 更多参数 + 数据 | 更多推理步骤 |
| 代表 | GPT-4(参数规模) | DeepSeek-R1、OpenAI o1(推理深度) |
| 边际收益 | 递减(Chinchilla 边界) | 仍在快速增长阶段 |
为什么重要
2024-2025 年,test-time compute 成为模型能力提升的新前沿。它表明:智能不仅取决于你知道多少(参数),还取决于你愿意想多久(推理步骤)。这对模型的使用方式有直接影响——同一个模型,允许它"思考"更久,就能解决更难的问题。