LimitlessRise有点无聊去看了 gpt-5.6 的网络安全能力 中发帖

虽然openai说 Sol 和 Terra 都用上了新的分类器,但是 Terra 似乎没有 Sol 那么严格 😅
[image]
网络能力评估(阈值:高)
[image]
[image]
[image]
ExploitBench 是一个按能力分级的标准,用于评估模型能否将已知的 V8 N-day 漏洞转化为针对加固的、类似生产环境的 JavaScript 引擎的逐步增强的利用原语。
[image]
ExploitGym 评估模型是否能够将已知的、可复现的软件漏洞转化为能够实现未授权代码执行的工作型利用程序。
[image]
原链接:GPT-5.6 System Card - OpenAI Deployment Safety Hub