@SmallMain 在 记一次对 DeepSeek V4 Flash 0731、GPT 5.6 Luna/Sol、Claude Opus 5、Grok 4.5、Kimi K3 的真实项目需求的横向评测(仅 284B 的 T1 模型!) 中发帖
由于测试的模型越积越多了,表格会删除一些同厂商的旧模型,你可以在之前的评测帖子里找到它们的成绩。
项目
这是一个 Unity C# 项目,我进行测试的是一份皮肤系统需求案,我已经做了好预制体,而模型需要编写代码。
本轮与上两轮评测的项目和环境都完全一致:
第一轮
…
上一轮
模型来源
Grok 4.5: Grok Build
Kimi K3: 火山 Agent Plan
Claude Opus 5: Claude Code 自行中转
GPT 5.6 Sol/Luna: Codex 自行中转
DeepSeek V4 Flash 0731: 官方 API
速度
排名
模型
时间(分钟)
备注
1
Composer 2.5
3
2
Grok 4.20 0309 Reasoning
3
3
Step-3.5-Flash
6
4
Mimo V2 O...