William (@Lee_William)GLM 5.3 评测: 有进步, 但不应该发生的地方却有小问题 中发帖

使用了HUB站的渠道进行的测试, 应该是GLM 5.3, 使用的reasoning_effort是high: 
[s1]
[s2]

整体评价: 之前也测试过GLM 5.2, 已经比较好完成了测试, 测试了两次, 严格来说都失败了:
第一次: 错的地方就只要加一行if(!xx)return就解决了
第二次: 就是输出格式有问题, 我要求输出的代码块要换行, 它混了文本没有换行, 内容都是对的
两次都是这么多代码就差这么一点点, 都是一些非常简单的小地方出了问题, 觉得可惜和不解.
如果忽略小问题, 本项测试简单来看已经有进步, 不过题目已经难不住模型, 可能需要更难的测试题才能比较好对比.

之前GLM 5.2评测:


PS:
之前是使用max,这次是使用high, 不使用max是HUB站有10分钟超时, 使用max时对话时间达到10分钟被中断了, 而且中断在rea...