王大锤 (@Fwrd) 在 Terminal-Bench 3.0换王:Opus 5以43.5%压过GPT-5.6 Sol 中发帖
Terminal-Bench 3.0 最新榜单换王。这个评测让 AI Agent 在真实终端环境里完成任务,最后直接检查结果是否正确。
当前前三名分别是:
Claude Opus 5 Max + mini-SWE-agent:43.5%
GPT-5.6 Sol Max + Codex:34.6%
Claude Fable 5 + Claude Code:34.1%
Terminal-Bench 3.0 在 7 月 23 日上线,目的就是把题重新做难。旧版前沿模型的成绩已经挤在一起,新版本希望重新拉开差距。首版有 74 道任务,覆盖 7 个领域,还加入 GPU、多容器网络等更复杂环境。任务也不只是写代码,还可能要求提交模型权重、形式化证明、电子表格和 CAD 文件。
不能直接理解成 Opus 5 本身比 Sol 强近 9 个百分点。Terminal-Bench 允许模型搭配不同 A...