@scp3500 在 gpt不同思考挡位在Terminal Bench4.0上的跑分图 中发帖
DeepSWE 榜上 Gemini 3.8 Flash 和 GPT-6 Astra 分数接近,但它们实际用的差距却很大
因此我做了一张以 Terminal-Bench 4.0 的跑分为主轴,结合 OpenAI 放出的 GPT-6系列 DeepSWE 跑分图的风格
说明:
Terminal-Bench 4.0 的跑分与价格数据均来自 Artificial Analysis(AA 站)
我顺手补了最新的 Claude Opus 5.5 模型
评分仅供参考
[06d87cb267e55501e21b56fc3f0c2331]