sandiferresnerDeepSeek V4.1 Flash 论文里面关于思考强度相关的内容可以解答一些使用体验上的问题 中发帖

看了 V4.1-Flash 的技术报告,说一下它 Reasoning Effort 机制的重点。 

Effort 现在是数字,三档只是预设

底层是一个 1–100 的标量。API 上还是 low / high / max 三个名字,但它们只是三个预设点, 分别是 50, 75, 100. 训练里只用了几个档位,但中间值也能插值生效——同一个模型,不换权重、不改采样参数,靠这个数字在「省钱」和「使劲想」之间滑动。

怎么实现的

说白了很朴素:在 system prompt 前面加一行「Reasoning Effort: N」,然后用 RL 把它练成行为。具体机制是奖励里有一个思考长度的惩罚项,effort 数字越高、每多写一个思考 token 挨的罚越轻。所以模型「想多久」是被这个数字直接调控的,而且单轮推理和 agent 任务用的是同一套机制。

实测效果(报告数据)

effo...