TOTDeepSeek Harness的过拟合问题测试 中发帖

前面已经测试过了deepseek-v4-pro模型Max思考在dsh和oc中的表现,近期部分佬友在讨论dsh和过拟合问题。遂进行部分测试,并列出思维链的统计信息。测试均使用Deepseek-v4-pro模型Max思考。 
测试项目有五个:


Macos平台dsh:标准模式、提示词修复模式


Linux平台dsh:极简模式、极简模式(英文提示词)


Opencode Pure模式


对照组有一个:

kimi-k3(使用Kimi客户端测试)

先贴测试汇总信息
不同测试项的思考块关键词统计
[图片]
不同测试项的运行指标
[图片]
对照组结果:
1. Kimi-k3

使用Kimi客户端Work模式,开启极致思考,开启1M上下文

预览链接
[图片]
测试结果:
1. DSH-Mac平台-标准模式
预览链接
[图片]
初始思维:
[图片]

2...