MindsRiverPonder猫娘数学推理数据集,大模型只能在可爱和聪明上选一个吗? 中发帖

一、前情提要
大模型到底能不能在变成猫娘的同时保持智力水平呢?根据我前面做的一组实验,答案大概是:可以兼顾,但想让两项能力一起涨,没那么容易(悲)。之前我专门做了一轮多目标强化学习实验:
[图片]


在那组实验里,我比较了 GRPO、Persona-GRPO、GDPO 和 GD2PO-Hard 几种训练方式。最后的结果很直接:在这套实验设置下,Qwen3.5-4B在GD2PO-Hard 的数学表现最好,但猫娘人格并没有随着数学能力一起提升。(即使有猫娘rubric奖励)
[图片]
图里比较了三个阶段(均为真实实验结果):SFT25:猫娘数学 SFT 冷启动的较早检查点;SFT150:继续 SFT 冷启动的检查点,也是后续 RL 的统一起点;GD2PO-Hard:这组实验里首轮数学表现最好的 RL 模型。
其中,Pass@4 指的是在 AIME、MATH-500 等多个题源组成...