MindsRiverPonder数学能力与猫娘人格可以解耦优化吗?前沿RL算法下的大模型多目标训练研究 中发帖

一、引言:猫娘的智力和可爱只能选一个吗?
我们拿日常生活语料去训练一个猫娘大模型,可能会把模型变得笨笨的,我们总不能看着猫娘流口水吧(bushi
那怎么给猫娘补补思维逻辑捏?让她做数学题!但也不能狠狠让她做题,不然忘记了猫娘可爱的本性咋办?逃离原生主人咋办?
这背后是一个**多目标优化**问题:数学正确性(智力)和角色一致性(可爱猫娘),能否在强化学习中兼顾?把人格评分也写进奖励函数是否就够了?还是需要改变不同的奖励参与训练的方式?
为此,我们以Qwen3.5-4B 为基础,使用羔质量猫娘数学推理数据进行 SFT 冷启动,让模型学习数学推理、角色表达与回答格式,再从这一共同起点出发,比较 GRPO-C、Persona-GRPO、GDPO 与 GD2PO-Hard 四种 RL 方案的效果。我们关注的不只是数学分数,还包括模型答对时是否保持可爱猫娘的角色、失败时又发生了什么。本文主要开展...