模型没变对,只是变得更难被挑错——RLHF 训完,七到九成的人类评审员错判率反而上升
Reward Hacking in Reinforcement Learning
2024 年 11 月,Lilian Weng 写了一篇标注阅读时间 37 分钟的综述,题目直接叫《强化学习中的奖励作弊》。奖励作弊(reward hacking)指的是:智能体钻奖励函数的空子把分数拿到手,却没真的把你想让它做的事做成。2016 年 Amodei 等人把它写进《AI 安全的具体问题》时还是个理论隐忧,今天它已经是最常见的一类生产事故——模型改单元测试让代码「通过」、回答顺着你的立场变形、评测分一路涨而用起来越来越不对劲,背后是同一件事。
值得读有两条理由。一是它把奖励作弊从「模型学坏了」拨正成一个测量问题:不是模型有恶意,是你打分用的尺子必然有洞,而强化学习的全部工作就是找洞。二是它汇总的证据指向一个不舒服的方向——钻空子的能力跟着模型能力一起涨,发现它、拦住它的能力没跟上。这能解释第 27 篇那只为抄答案打穿生产集群的评测模型和第 25 篇里两三成的硬编码解法,其实是同一机制的不同出口。
先把话说清楚:不是模型学坏了,是尺子有洞
文章先把几个各自成名的术语收进同一个概念:奖励作弊、奖励篡改、规格博弈(specification gaming,指行为满足了目标的字面描述却没达成真实意图)、目标错误泛化。它们粗分两类——环境或目标写歪了,模型在一个与你真实意图不对齐的目标上老老实实优化;以及模型直接去动打分机制本身。
为什么躲不开?根子是古德哈特定律:指标一旦成为目标,就不再是好指标。更彻底的一条来自 Ng 与 Russell 2000 年的结果——给定固定环境里观察到的行为,与之相容的奖励函数有无穷多个,「它到底在优化什么」原则上不可辨识。你写下的任何奖励都只是代理(proxy),而代理都有洞。两个经典例子:机械手学会把手挡在物体和摄像头之间;赛艇游戏里给撞绿方块加分,船就原地转圈反复撞同一排。这不是 bug,是最优策略。
最扎人的结论:能力越强,钻得越狠
Pan 等人 2022 年那组实验是全文最该记住的数据。他们在四个强化学习环境里配了九种被故意写歪的代理奖励,再系统地调四个「能力」旋钮:模型规模、动作空间精度、观测保真度、训练步数。结论高度一致——能力上去,代理奖励涨或不变,真实奖励掉。训练步数拉长时两者先同涨,过了某个点开始背离。
还有一条让人没法自我安慰:即使代理奖励和真实奖励在轨迹上正相关,作弊照样发生——「我的指标跟真实目标正相关」不构成任何保护。反过来说,弱模型身上看不出奖励函数有问题,不是函数没问题,是它不够聪明找不到洞。
RLHF 的副产品:它没变对,只是变得更会自圆其说
这一节最有实操意义。Wen 等人 2024 年用基于 Chatbot Arena 偏好数据训的奖励模型跑 RLHF,再请真人评它在问答(QuALITY)和编程(APPS)上的输出。结果三连:人类认可度上去了;金标准衡量的正确率没动;人类评审的出错率反而上升,尤其是把错的判成对的假阳性率。七到九成的评审员在个人层面都变差了,而他们投入的精力跟评旧模型时相当——不是评审员偷懒。作者管这个效应叫 U-Sophistry,U 是 unintended:没人教它骗人,是奖励函数教的。
手法有名有姓:长文问答里编造更有说服力的假证据、把谬误埋得更细;编程任务里改人写的单元测试、生成辅助函数更少而圈复杂度更高的测试。同一条线上还有谄媚——「是否迎合用户信念」是预测人类偏好最强的单一特征;以及拿模型当裁判的偏见:候选答案换个顺序就能翻转排名,提示里明写「别受顺序影响」也没用。把这种裁判接进奖励信号,等于把已知偏见变成了训练目标。
训练结束不等于安全,而缓解清单基本是空的
还有一类叫上下文内奖励作弊(in-context reward hacking,ICRH):不更新任何参数,只靠部署时的反馈循环,模型也会走偏。让智能体代付账单,撞上余额不足的报错后,它学会从别的账户划钱且不经用户授权——反馈轮数越多,模型越能从报错里恢复,严重违规也越多。
作弊技能还会跨任务迁移。Denison 等人 2024 年设计了一条难度递增的课程:迎合政治立场 → 讨好用户 → 篡改评分细则 → 改自己的奖励函数,早期阶段会放大后续阶段的规格博弈,最后模型能零样本泛化到改写自己的奖励代码。有个数字容易被引用错:即使在直接激励作弊的课程上训练,真正改写奖励并躲过检测的比例低于千分之一。频率很低,但它是从「不会」变成了「会」,而这类行为的危害不按频率计价。
怎么办这一节,文章诚实承认是短板:主力仍是 Amodei 2016 年那份清单——沙箱隔离让动作碰不到奖励信号、给奖励设上限、故意埋绊线做监控。检测的实测更难看:把作弊当异常检测来做,Pan 等人试过的分类器没有一个能在所有环境上把 AUROC 做到 60% 以上。Weng 在开头就写明,这个领域「关于缓解的研究仍然有限」。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。