蓬莱 (@PengLaiDoll)看到好多佬在讨论DeepSeek的“Let me”和"We",特别让ChatGPT调研报告了一下 中发帖

从DSH出来之后就一直看到很多佬在尝试利用Harness复现灰度测试的性能。先说我自己,我在0813当天上午就偶然看到Opencode Go已经上了Pro(New)了,也试了Nameeee,发现可以正常输出。试着用Opencode跑了几个小项目,发现有时是Let me,有时是We,很奇怪,但是当时没仔细测模型到底是个什么水平。后面又用Flash试了一下,发现我Flash反而稳定输出Let me,就越发觉得不太对。这两天一直用DSH干活,又发现出现了和之前一样的情况:有时是Let me,有时是We,但结果有点出乎意料,Let me思维链的有时效果反而比We的好(相同提示词,任务是处理表格数据),小白也不太懂,就让ChatGPT写了一个调研报告 
[image]
详细报告可参考:ChatGPT - 思维链对性能影响