ab (@abRoy) 在 论文解释了为何ds V4 Pro出现极大的上下限波动 中发帖

[image] 
[20261008-195245]
总结:

DeepSeek-V4 / V4.1 中的实证证据(第2节)
代码补全例子:让 DeepSeek-V4-Flash-Base 补全它自己的 FP8 量化推理代码,仅改变前置装饰性 docstring 的长度(1个token),首选补全就在 “8”(正确)与 “32”(错误)之间以4为周期翻转(即其压缩步长 S=4)。四种 filler 家族、后训练版本(0731、V4.1)均复现,周期分别匹配各自步长;无分块压缩的 DeepSeek-V3.1-Base 无此模式。
NIAH 检索评测:128K token、16k 键值对,按目标键位置 mod 8 分组,组间查询位置、prompt 长度、目标位置均值/方差严格匹配。结果:基座模型各相位检索精度差距最高达 40.2 个百分点;后训练收窄但依然显著(19.1pp);V4...