@cogoxu 在 GLM-5.3-Flash 我要打十个 中发帖
Z.ai 先后发布了 GLM-5.3 和 GLM-5.3-Flash 两份评测报告,但两张图的基准版本并不一致(比如 Terminal Bench 一个用 2.1、一个用 3.0),直接对比会产生“84 分 vs 28 分”的错觉。我把两份报告的原始数据提取出来,对齐到同一基准,并补上 Kimi K3、GPT-5.6 Sol、DeepSeek-V4 Pro 作参照,整理成下面这张表。
基准
能力域
GLM-5.3
GLM-5.3-Flash
Kimi K3
GPT-5.6 Sol
DeepSeek-V4 Pro-0813
Terminal Bench 2.1
终端任务
88.2
84.3
88.3
88.8
87.9
Terminal Bench 3.0
终端任务(加难版)
28.3
–
17.4
34.6
–
DeepSWE v1.1
复杂软件工程
66.9
6...