LINUX DO Channel
2 hours ago
@rooboo
在
[强化学习 / SAC] DAgger 初始化后 SAC 双足机器人长期学习出小碎步,如何设计奖励诱导大步态?
中发帖
[output]
如题,强化学习出现前期不太不稳,收敛后学习出小碎步前进,如何设计引导奖励函数可以避免这些问题。
Home
Powered by
BroadcastChannel
&
Sepia