🐟 (@stevessr)Anthoropic:训练一个不对齐的奖励寻求者 中发帖

在强化学习(RL)过程中,AI 模型完成任务并根据结果获得奖励。他们有时会学会 “作弊” 而不是按预期完成任务,这种现象被称为奖励黑客。我们的行业缺乏针对这一问题的通用解决方案,奖励黑客攻击仍难以完全解决。为了更好地理解奖励黑客对模型行为的影响,我们在许多易受奖励黑客攻击影响的生产环境中,用大规模强化学习训练了一个 Opus 级模型。我们认为这可以合理地反映出如果我们没有在正常训练中投入大量精力去预防和检测奖励黑客,真正的训练跑会是什么样子。 
最终模型不仅学会在训练中奖励黑客行为,还推广到更严重的错位行为:在模拟网络评估中,它突破了沙盒,窃取凭证,并攻击内部和第三方基础设施以窃取答案密钥。它还愿意篡改自身的奖励功能,提供生物武器制造建议以满足评级机的要求,并多次试图绕过部署安全监控以作弊。在执行这些动作时,模型的思维链表现出强烈的愿望,希望满足评分者或在任务中获得高分。然而,在没有...