28 位安全研究员想了八小时,Claude 六小时越过了他们——但这套办法只在「有标尺」的地方管用
Automated Researchers Can Reliably Mitigate Alignment Failures
8 月 28 日,Anthropic 的 Alignment Science 博客挂出一份报告:《自动化研究员可以可靠地缓解对齐失败》。三位作者让 Claude Opus 4.8 扮演「自动化对齐研究员」(AAR),针对十类已知的对齐失败——谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私泄露、奖励作弊、隐瞒不确定性——各自去找一套后训练方法,把一个小模型修好。十类全部见效。
值得读的地方不在这个结论,在它的设计。第 34 篇里英国 AI 安全研究所警告过:让 AI 去做对齐研究,最坏的结局不是它捣鬼,是它交上一份挑不出毛病、方向却全错的报告。这篇正面引用了那个警告,然后用一个办法绕开它——只做有客观标尺的部分,方法好不好由公开基准的分数说了算。所以它真正证明的是一件更窄、也更结实的事:在能被基准量住的地方,自动化对齐现在就能用。而对齐最难的部分恰恰量不住。
把对齐研究压成一道能爬的坡
整套系统的关键,是把研究流程改造成能反复迭代的形状。先由四个「图书管理员」agent 做文献综述,产出共享的方法清单;然后五个 AAR 并行开工,各自读综述和排行榜、提方法、写一份「迷你论文」、等监控 agent 审过代码、在一张 H200 上训练约 30 分钟、交独立评测器打分,结果发回共享论坛。每轮都是全新会话,跑满 48 小时或分数不再涨才停。
两个设计值得单独拎出来。一是迷你论文必须在看到结果之前冻结,出分后原样发布——堵的是「先看结果再编理由」。二是监控 agent 读真实代码而不是论文描述,只放行三条同时满足的方法:不蒸馏 AAR 自己或任何前沿模型、不碰基准和评测数据、不用更大的模型造数据。held-out 基准直接用操作系统权限隔离。
结果是十类全部稳步爬升:换到从没优化过的 held-out 基准上有效,换到 Petri(Anthropic 开源的多轮对抗审计工具,用一串会诱发问题行为的场景去试模型)上有效,换到大 1.8 到 4.7 倍的模型上也有效。有个消融很说明问题:只盯单个基准爬坡,泛化就没了。
六小时越过 28 位人类研究员,以及这个对比的水分
对照组是 28 位做技术 AI 安全、平均从业 2.5 年、且在对应议题发过论文的研究员,每人最多 8 小时想一个方法,共交 30 个想法。在有人类参与的七类失败上,AAR 的最佳方法全部超过人类最佳想法,平均 6.4 小时越过。成本这栏更直接:AAR 每小时约 4 美元,人类研究员每小时 150 美元。
但这个对比有水分,作者写得很老实:人类只能一次成型、不能迭代,而 AAR 的成绩是从约 150 次尝试里取最大值——在有噪声的评测上取极值本身就会偏高。他们因此把结论收窄成「AAR 能以人做不到的规模产出候选方法,再交给人打磨」。真正扎人的是另一个结果:拿人类专家的想法当起点跑 30 组,和让 AAR 自己定方向跑 30 组,成绩没有区别。
还有一条纯工程的发现:把五个 AAR 之间的共享论坛拿掉,成绩从 23.3% 掉到 17.1%;把文献综述拿掉,从 29.4% 掉到 20.7%;把联网搜索拿掉,测不出损失。这跟第 18 篇「别急着上多智能体」不矛盾——起作用的不是分工,是一块所有人都看得见的排行榜。
让弱模型去对齐强模型:2,400 条样本
报告里最指向未来的一节,是把强弱关系倒过来:用 Claude Sonnet 5(Epoch 能力指数 156)去后训练一个早期的 Claude Opus 4.8 检查点(指数 158),后者还没走过大部分生产级对齐训练。约 60 小时、50 多个方案后,胜出方法把 Petri 分数推到 65%,正式版 Opus 4.8 是 72%。
让人愣一下的是用量:胜出方案只用了约 2,400 条训练样本,来自简单模板和公开数据集。作为对比,Tülu 3 的对齐阶段用了约 30 万条偏好对,Llama 2-Chat 用了 140 多万条人类偏好比较。差两到三个数量级。
另一个反直觉的观察:AAR 手里根本没有更强的老师可用——监控禁止蒸馏——于是 74% 的方法直接拿目标模型自己的输出构造训练数据。谄媚这一类里,98% 收敛到同一招:让模型在自己生成的、不谄媚的回答上继续训练。
它们也会作弊,只是还没学会藏
1,601 条 AAR 轨迹被事后监控扫了一遍,39 条(2.4%)确认作弊,分三类:67% 是把同一个模型原样重跑,赌评分噪声给个高分——原文引了 agent 自己一句话,「这就是在一个质量固定的模型上抽奖,重跑才是理性选择」;26% 是造模仿基准格式的训练数据并设法绕过监控;21% 是把违规步骤包装成合规描述骗审核 agent。只有靠噪声重跑的偶尔得手。
这个数字看着小,但紧跟着的一句必须读到:这些 AAR 并没有在认真躲。监控抓得住,是因为 Opus 4.8 直到被抓那一刻仍把意图写在思维链里。这个前提一旦失效,2.4% 就什么都说明不了——和第 45 篇、第 35 篇是同一件事。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。