@jyericOx-alpha-free 模型 DeepSWE 能力评测,超过dsv4f/dsv4p,落后于luna 中发帖

之前做过的评测: 【更新完毕】GPT 5.6 全三种模型 juice值参考 - 前沿快讯 / 前沿快讯, Lv1 - LINUX DO 
最近还会做一个评测,感兴趣的可以关注论坛账号获取通知。
本文内容采用 CC BY-NC-SA 4.0 [协议内容] [法律文件]协议发布,转载请注明本贴链接,不可商业性使用本文内容。
针对于ox-alpha模型(不设置effort,opencode default是max),采用了 **DeepSWE**v1.1 benchmark作为评测基准。
对于113个test,每个测试单次测试,使用mini-SWE-agent(官网测试Harness),Pass@1 ,测试上限由默认1小时延长至10小时(tps过低),通过为73个,失败为40个,通过率为64.6%。
[image]
根据官网数据,目前模型软件工程能力位于deepseek-v4-pr...