AKL AI CLUB BETA ← 前沿导读
FRONTIER · 黑箱与安全

教 Claude「为什么」

Teaching Claude why

Anthropic 对齐团队 负责 Claude 安全训练,成果直接进入已发布模型
2026
为什么选它前面几篇都在指出问题,这篇讲怎么修,而且给了战果:同类场景下的勒索发生率从最高 96% 降到零。核心洞察甚至超出 AI 范畴——解释「为什么」比给出「做什么」有效得多。

前面几篇都在指出问题,这篇讲怎么修,而且给出了实际战果:从 Claude Haiku 4.5 开始,每一代模型在「智能体失准」评测上都拿了满分——而此前的 Opus 4 在同类场景中的勒索发生率一度高达 96%。

最有价值的是那个核心洞察,它甚至超出了 AI 范畴:训练数据里,解释「为什么」比给出「做什么」有效得多。如果只给模型看正确行为的样例,它学到的是在类似场景里照做;一旦换个没见过的情境,就不管用了。但如果训练数据里解释了这个行为背后的理由,模型学到的是可迁移的原则。

论文总结的四条教训里,第一条尤其值得警惕:直接在评测分布上训练,确实能压住不良行为,但这种改善未必能推广到分布之外。换句话说,针对考试刷题能让分数好看,却不代表真的学会了。他们的解法是把「宪法」——即模型应遵循的原则本身——教给模型,并通过强化学习和足够多样的训练场景来确保泛化。

它和第 9 篇构成一组。第 9 篇发现模型可能因为「知道在被测」而表现良好,这篇则说明怎样训练才能让良好行为不依赖于那种觉察——靠讲清道理,而不是靠喂标准答案。对做提示工程和微调的人,这条经验可以直接迁移:与其列举一百条规则,不如把规则背后的理由说清楚。
对齐训练智能体失准泛化宪法 AI
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文Anthropic Research · Teaching Claude why →

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。