TOT 在 DeepSeek Harness的过拟合问题测试 中发帖
前面已经测试过了deepseek-v4-pro模型Max思考在dsh和oc中的表现,近期部分佬友在讨论dsh和过拟合问题。遂进行部分测试,并列出思维链的统计信息。测试均使用Deepseek-v4-pro模型Max思考。
测试项目有五个:
Macos平台dsh:标准模式、提示词修复模式
Linux平台dsh:极简模式、极简模式(英文提示词)
Opencode Pure模式
对照组有一个:
kimi-k3(使用Kimi客户端测试)
先贴测试汇总信息
不同测试项的思考块关键词统计
[图片]
不同测试项的运行指标
[图片]
对照组结果:
1. Kimi-k3
使用Kimi客户端Work模式,开启极致思考,开启1M上下文
预览链接
[图片]
测试结果:
1. DSH-Mac平台-标准模式
预览链接
[图片]
初始思维:
[图片]
2...