@keenturbo 在 91分瞬间变99分!DeepSeek V4 Pro 性能大起大落?开源社区消融实验揭秘底层真相 中发帖
DeepSeek V4 Pro 正式版不如预期,因为模型就像一个被训练成看菜下饭的厨师。如果第一眼看到厨房里摆了 25 种工具,它开始纠结 “我先拿哪个、我试试这个、我再看看那个”,动作很多但效率低。那如果第一眼看到厨房里只有 2 种工具,它反而专注:“我们要做这道菜,直接开干”,干净利落。
导语:正式版不及灰测?一场社区掀起的 “性能大侦探”
DeepSeek V4 Pro 正式发布后,AI 社区出现了一个诡异的现象:
官方/灰测数据:跑分高达 96~99 分,几乎打平全球顶级基准。
用户实测体验:有人跑 Terminal Bench 只有 79~91 分,思考过程充斥着低效的 “我来试试……”“让我想想……”(Let me…)等绕圈圈行为。
难道 DeepSeek 在正式版里把模型权重 “暗降” 了?还是训练出了问题?
开源社区没有停留在口水仗,而是通过硬核消融实验(Abl...