o.o (@Sevenyine)近期一种获取AI模型内部思维链的方式 中发帖

原理
因为直接破解模型原始思维加密困难,_can1357 使用了“不破解,而是欺骗模型”的方法。其原理为:关闭AI模型自带的思考,同时提供一个“deep_think工具”。模型在生成回复时,会主动调用这个工具并在其中写下自己的思维过程,从而让人能够“获取未加密的思维链”。这种方式提取出来的思维链的行文、用词等很像模型的内部草稿,因而推断是“模型的思维链”。_can1357 的截图中,也出现了模型说“(这里的内容)用户看不见”。
[image]

_can1357 on X 提供的PoC(概念证明):pasta.can.ac/omegiligox.py
[image]
[image]
争议
这种方式本质上并不是真正破解了官方加密的思维链。但它通过关闭官方推理,且伪造一个推理工具,让模型认为自身正在进行内部推理,且用户不可见。这种方式获取的思维链或许与模型通过官方推理生成的真正的...