@qomos对于最近国内的模型能力谈谈我的看法 中发帖

连续一个多月使用多agent编排来编程,相对于单项任务的完成程度,我的体会是如果追求人在回路权重的减少,模型的全局视角和思维连续性更加重要. 
目前实际使用下来,国内现在做到这一点的是glm-5.2以及glm-5.3,国外opus4.6以上gpt terra以上都达到及格线,kimi k3能勉强摸到门槛,但是在指令遵循方面好像有一定的问题,总体来说k3和5.2,5.3都有能力替代程序员本身完成对任务的拆解和编排并对整体完成度进行验证.
这一类模型的典型特点是思维准确,废话很少,思维链相对较短(glm5.2是个特例,思维链较长但是长程能力比较不错).使用中发现,类似deepseek v4f这类思维链较长的模型在可能会陷入局部注意力而导致编排失败.
在多agent编排中干活的worker,只要有基础的编程能力和指令遵循都能很好的工作,模型的好坏取决于速度和编程的准确率,包括deepseek...