@Teruteru[Arxiv] 论文分享:从专有 LLM API 中窃取推理痕迹 中发帖

其中附录提到 

本附录中的大多数实验使用了推理前缀。我们在一个开放权重模型的推理开头插入一段已解码的Claude Opus 4.8或GPT-5.6-Sol推理片段,然后让模型自由继续生成。我们将这些生成结果与两种条件进行比较:一种是无前缀条件,即模型产生其原生推理;另一种是自前缀对照,即模型接收来自其自身先前推理的前缀。可见答案始终是自由生成的,从不预填。我们使用三类互补的测量方法。风格分类器测试生成的推理是否变得更难与源模型区分。特征性n-gram重叠识别出与源模型共有的具体短语,并测试该效应是否延伸至可见答案。词元级别概率和困惑度衡量源模型推理或答案的精确片段在目标模型下是否变得异常可能。我们观察到三个令人惊讶的发现。
第一,对于Kimi-K3,Opus推理前缀也将可见答案的风格转向相应的Opus答案。
第二,评估已解码的Opus和Sol文本在Kimi-K3和GLM-5.2下...