@12dora【横评】7 大模型 21 种配置大乱斗, 究竟谁是代码探索Agent之王 中发帖

前言: 多Agent协同工作时, 如何设置不同角色的模型和思考强度往往是个问题, 例如探索代码就像主Agent的眼睛, 如果质量不好会直接影响设计和执行. 那么如何知道什么模型最适合担任代码探索角色, 这次请出 A/(Opus 5), O/(GPT5.6 系列), Grok, Cursor. 7个模型共计21种配置决一胜负. 
注: 所有模型都为正价官订, 不存在降智等问题, 本报告由我+Fable5联合编制.
测试集: 从我开发的一个复杂企业级业务系统中让fable抽取2个复杂代码文件, 同时交给21个Agent去做代码探索
参赛模型: Opus 5、Grok 4.6、Grok 4.5、GPT- 5.6-Sol、GPT- 5.6-Terra、GPT- 5.6-Luna、Composer 2.5
太长不看版结论:

Opus5擅长review确有其事, A/在发布稿中说低effor...