huruiyang 在 同是 Terminal-Bench 2.1:DeepSeek 图中 Fable 5 为何是 88.0,GPT-5.6 页面却是 83.8? 中发帖
看到两张官方图里的数值似乎对不上,想请教一下大家:
DeepSeek V4 Pro 官方对比图中,Terminal-Bench 2.1 一项里标的是 Fable 5 (w/ fallback) = 88.0。
GPT-5.6 介绍页的成本—分数图里,Claude Fable 5 对应大约 83.8;同一张图又把 Claude Mythos 5 单独标成 88.0。
我目前的猜测是:DeepSeek 图里用的自己的Harness。
有了解评测配置或原始来源的佬友吗?这两个数字能否直接横向比较?尤其想确认 DeepSeek 图中的 88.0 到底对应什么模型和运行配置。
(下附两张截图)
[c03eca00dc2bac4d6705ae2973875c0c]
[image]