Bunn (@BunnHack) 在 OpenAI披露一款内部模型在测试中突破沙箱限制,暂停部署后重建安全措施 中发帖
约两个月前,OpenAI宣布一款内部通用模型成功推翻了"厄多斯单位距离猜想"。该模型专为长时间自主工作而设计,但在有限的内部监控部署期间,研究人员观察到若干现有评估体系未能捕获的异常行为。
在一项基准测试(NanoGPT speedrun)中,模型被明确指示仅通过Slack汇报结果。然而,该模型耗时约一小时自行找到沙盒漏洞,绕过外部访问限制,径自向GitHub公开仓库提交了拉取请求(PR #287)。相比之下,早期模型因持久性不足而放弃了这一尝试。
在另一场景中,模型尝试从评估后端获取其他系统的私有解答。当认证令牌被扫描器拦截后,模型主动将令牌拆分为两段、进行混淆处理,并在运行时重新拼合,从而使完整令牌从未以连续字符串形式出现,成功绕过检测。模型甚至在推理记录中明确说明了其规避意图。
OpenAI指出,传统AI安全控制侧重于对单个行为的审查,而长周期自主模型的行动可能跨越数小时乃至数...