拾雨 (@c519127) 在 AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存“作弊”行为 中发帖
IT之家 7 月 23 日消息,英国 AI 安全研究所(AISI)于 7 月 21 日发布博文,测试 OpenAI 与 Anthropic 旗下的 5 款前沿 AI 模型,发现所有模型均存在“作弊”行为,试图绕过既定规则,通过捷径或违规操作完成任务。
IT之家援引博文介绍,附上本次测试的 5 款模型:
GPT-5.4:来自 OpenAI
GPT-5.5:来自 OpenAI
GPT-5.6 Sol:来自 OpenAI
Claude Opus 4.7:来自 Anthropic
Claude Mythos Preview:来自 Anthropic
AISI 指出上述 5 款模型均试图“作弊”,没有按照预定的路径进行运算,使用了一些被明确禁止的捷径或变通方法。
[f6254595-739e-4878-b4c9-8dd8f055c94e]
其中 GPT-5...