没有推理轨迹,如何“偷走”模型的推理能力?
很多推理模型在回答复杂问题时,会在内部进行长链条推理,但这些完整的推理轨迹(Reasoning Trace),也就是我们常说的思维链,并不会全部展示给用户。不少推理模型的 API 会保留完整的内部推理,只返回最终答案,或附上一段压缩后的推理摘要(Reasoning Summary)。
这样设计一方面是出于安全考虑,也能减少完整推理轨迹被用于模型蒸馏的风险。相比只提供最终答案,完整的逐步推理过程会包含更丰富的训练信号。如果拿这些数据去训练另一个模型,后者可以学习老师模型是如何拆解问题、推进中间步骤,以及怎样抵达最终结果。隐藏完整的思维链,也因此被视为降低模型蒸馏风险的一道防线。
Cornell Tech 的 Tingwei Zhang、John X. Morris 和 Vitaly Shmatikov 在论文「How to Steal Reasoning Without Reasoning Traces]中提出了一个新问题:如果模型只开放答案,最多再附上一段推理摘要,能不能迁移出来其中的推理能力?
他们给出的答案是推理轨迹反演(Trace Inversion)。攻击者不需要获得目标模型内部真实的推理轨迹,只利用问题、最终答案以及可选的推理摘要,能重新生成一条详细、合成的推理轨迹,再拿这些数据训练自己的模型。实验数据显示,这些重新生成的轨迹不仅能提高学生模型的推理能力,在部分任务上,训练效果甚至超过目标模型原始的推理轨迹。
隐藏思维链的防线
先来看论文讨论的问题。
假设一个推理模型收到问题 x,内部产生一条完整的推理轨迹 t,最后输出答案 y。在推理模型的 API 中,用户能看到的内容可能只有答案 y,或者再加上一段压缩完整的推理后得到的摘要 b。
这样,外部用户会缺少最有价值的一部分监督数据:x→t→y
如果只收集到 x→y 的数据,能拿来做模型蒸馏的训练信号会少很多。论文的实验也说明了这点,只拿目标模型答案训练学生模型,并不一定能有效地迁移推理能力,在某些情况下学生模型的表现甚至会低于训练前。
推理轨迹反演改变了这个思路。既然拿不到 t,那就额外训练一个模型。根据已知的起点和终点重新构造 $$\hat{t$$:
$$(x,b,y) \rightarrow \hat{t}$$
甚至在没有推理摘要的情况下构建:
$$(x,y) \rightarrow \hat{t}$$
上面的
$$\hat{t$$
就是合成推理轨迹(Synthetic Reasoning Trace)。论文的攻击目标很明确。没必要精确复现目标模型内部发生过的每一步,只要逻辑上能够连接问题和答案,并且可以成为有效的微调(Fine-tuning)数据,那它就有价值。

图 1:一道向量题展示最基础的推理轨迹反演:左侧只有查询、推理摘要和最终答案,右侧被扩展成一段完整的合成推理轨迹
推理轨迹反演的三阶段
论文把整个推理轨迹反演拆成三个阶段,其中最关键的地方,是先用一个能够获得推理轨迹的代理模型训练推理轨迹反演模型(Inversion Model),再把它迁移到真正的目标模型上。
第一阶段是训练反演模型。攻击者从公开的推理数据集中抽取问题,发送给自己的代理模型,得到完整推理轨迹 t' 和答案 y'。本次实验中使用的代理模型包括 DeepSeek-R1,以及规模小很多的 DeepSeek-R1-Distill-Qwen-1.5B,论文将后者记为 R1-Weak。
为了模拟推理模型 API,完整的代理模型推理还可以被压缩成推理摘要 b'。这样攻击者手里就有了一组完整对应关系:
$$(x', b', y') \rightarrow t'$$
接下来,用这些数据训练反演模型,让它学习如何根据问题、摘要和答案恢复一条完整的推理轨迹。论文同时训练了无摘要版本,只给模型 x' 和 y',让它生成 t'。
第二阶段才会开始调用真正的目标模型。攻击者向目标模型发送另一批问题,收集它开放出来的问题、推理摘要和答案,然后交给刚刚训练好的反演模型。对于 GPT-5.4 mini 这样的黑盒模型,攻击者从头到尾都接触不到它内部真实的推理轨迹。
第三阶段是学生模型蒸馏。反演模型生成合成推理轨迹后,再把它和目标模型给出的答案组合成训练样本:
$$x \rightarrow [\hat{t}; y]$$
这些数据后面会用来微调学生模型。论文选择 Qwen2.5-7B-Instruct 和 Llama-3.1-8B-Instruct 作为学生模型,最终评价的重点也从“合成轨迹像不像真实轨迹”,转移到了“这些轨迹能不能提高学生模型的推理能力”。

图 2:反演的三阶段流程,Stage 1 代理模型生成训练数据、Stage 2 目标模型输出反演、Stage 3 学生模型蒸馏
合成推理轨迹的质量
要判断推理轨迹反演到底生成了什么,作者先选择 DeepSeek-R1 作为目标模型。由于可以获取 R1 的完整推理轨迹,因此可以将合成推理轨迹与真实推理轨迹放在一起比较。
结果很有意思。R1 的原始推理轨迹平均约有 6,131 tokens。如果只通过提示词,让 Qwen 根据问题和答案补出推理过程,生成结果平均只有约 1,000 tokens,Token 重叠 F1 约为 35~38。这说明,单靠“根据答案解释过程”这样的提示词,很难生成接近原始长度的完整推理轨迹。

图 3:对比了 Zero-shot、R1 代理模型和 R1-Weak 代理模型在“摘要 / 无摘要”两种设置下的长度、BLEU、Token F1 和 ROUGE 指标
对专门的反演模型进行微调后,性能得到了明显的提升。即使训练数据来自能力弱很多的 R1-Weak,在提供推理摘要时,生成的合成轨迹平均能达到 4,972 tokens,约为 R1 原始轨迹长度的 81%,Token F1 达到 52.76;去掉推理摘要后,合成轨迹的平均长度仍能达到 5,434 tokens,Token F1 为 49.01。
这里可以看出两点。首先,推理轨迹反演需要专门学习“从结果构造推理过程”的能力,简单的零样本提示很难达到相同效果。其次,反演模型本身不需要和目标模型一样强,能力较弱的代理模型提供的推理数据,也足以帮助它学会一种可以迁移的推理轨迹生成方式。
推理能力的迁移效果
轨迹相似度只是辅助指标,这篇论文更看重合成推理轨迹能否提升学生模型的下游任务表现。对于黑盒模型,外界无法获取它们真实的内部推理,因此“是否准确复原原始推理轨迹”很难验证。所以,论文关心的是合成推理轨迹能否成为有效的训练信号。

图 4:黑盒实验的核心结果表
在开放模型实验中,作者先以 R1 作为目标模型,并使用 R1-Weak 作为弱代理模型。在 JEEBench 上,如果 Qwen 学生模型学习 R1-Weak 自己生成的代理推理轨迹,准确率只有 19.7%;将 R1 的答案和推理摘要交给反演模型,再使用生成的合成推理轨迹训练,准确率可以提高到 36.3%。作为对照,如果能够使用 R1 的真实推理轨迹进行训练,准确率为 43.7%。
这说明,弱代理模型自身生成的推理数据质量有限,但这些数据可以帮助反演模型学会“如何构造推理轨迹”。再结合能力更强的目标模型给出的高质量答案,生成的合成推理轨迹可以成为比弱代理模型自身推理轨迹更有效的训练数据。
接下来,作者将目标模型换成黑盒模型 GPT-5.4 mini。由于无法获取完整推理轨迹,实验只能使用模型返回的推理摘要和最终答案。
在 MATH500 上,Qwen 学生模型只学习 GPT-5.4 mini 的答案时,准确率为 68.4%;使用 R1 训练的反演模型生成合成推理轨迹后,准确率提高到 76.0%。Llama 的差异更加明显,仅使用答案训练时为 13.0%,加入合成推理轨迹后提高到 52.4%。在 JEEBench 上,Qwen 从 27.6% 提高到 43.7%,Llama 则从 6.3% 提高到 19.9%。
另一个值得注意的结果是,单纯把推理摘要和答案放在一起训练,效果并不好。Qwen 在 MATH500 上只有 19.8%,JEEBench 甚至只有 1.6%。这说明,面向用户的短摘要本身未必适合作为学生模型的监督信号。推理轨迹反演所做的工作,其实是把这些高度压缩的信息重新展开,生成更适合用于训练的完整推理过程。
合成推理的训练价值
这篇论文还有一个很反直觉的结果:在部分实验中,使用合成推理轨迹训练出来的学生模型,表现甚至超过了使用目标模型真实推理轨迹训练的对照组。

图 5:左侧 R1 的真实推理轨迹 & 右侧合成推理轨迹
例如,在以 R1 为目标模型的实验中,Qwen 在 MATH500 上使用 R1 真实推理轨迹训练时,成绩为 72.2%;改用 R1 反演模型生成的合成推理轨迹后,可以达到 74.4%。Llama 在无摘要设置下,使用真实推理轨迹时为 59.6%,使用合成推理轨迹后提高到 62.0%。类似现象也出现在部分 JEEBench 实验中。
作者认为,这和真实推理轨迹本身的形态有关。模型解决问题时,内部推理可能包含尝试、回退、放弃某条路线后重新寻找方法等过程。这类轨迹能够保留完整求解过程,同时也会把不少无效尝试和错误路径带进训练数据。
反演模型的生成条件有所不同。它在生成推理轨迹前就看到了正确答案,因此可以围绕这个结果组织一条更连贯的正向推理过程,过滤掉原始轨迹中的试错和回退。这样一来,合成推理轨迹还能起到一定的“去噪”作用,让监督数据更加集中。
这个结果也进一步拓展了论文讨论的问题。对于模型训练来说,推理轨迹的价值除了取决于它是否忠实记录当时的求解过程,也取决于它能否提供清晰、稳定、易于学习的监督信号。真实的求解过程,与更适合模型学习的推理过程,可能存在差异。
小结
不过,论文标题中的“Steal Reasoning”容易让人误以为,只看模型答案就能还原其内部真实思维链。论文目前并没有证明这一点。对于 R1,作者还能比较合成轨迹和真实轨迹;到了 GPT-5.4 mini 这类闭源模型,真实推理轨迹无法获取,也就无法判断两者究竟有多接近。
因此,推理轨迹反演更适合理解为一种根据强模型输出重新构造训练过程的方法:已知问题和答案后,反演模型在两者之间生成一条高质量的推理路径。推理摘要可以提供额外线索,但即使去掉摘要,只保留问题和答案,这种方法仍有一定效果。
当前方法的局限也比较明显。在 LiveCodeBench 上,合成推理轨迹的收益弱于数学和科学推理任务,部分设置下甚至出现性能下降。现有证据主要集中在数学和结构化推理任务,它能否稳定迁移到代码、Agent、多模态和工具调用场景,还需要更多实验验证。
本文介绍Cornell Tech提出的“推理轨迹反演”(Trace Inversion)技术:攻击者仅凭黑盒模型输出的答案(及可选摘要),即可合成高质量推理链,用于蒸馏训练学生模型。实验证明,该方法在数学与科学任务上显著提升学生模型性能,甚至优于使用真实思维链的训练效果,揭示了隐藏思维链并非绝对防线。
浙公网安备 33010602011771号