1,367 人要的那个刹车,终于有人画出了图纸——第一页写着:全世界会造它的人不到 50 个
How Should the US Prepare for Increasingly Automated AI R&D?
2026 年 7 月,1,367 名前沿实验室员工联署了一封公开信,要求美国政府牵头建立「有意识地控制自动化 AI 研发速度」的能力——本栏第 33 篇写的就是它。信递出去之后,真正的问题才开始:那个刹车具体长什么样?谁来造?多少钱?8 月 6 日,华盛顿智库 Institute for Progress 交上来一份答卷,七名作者,牵头的是 Tim Fist 和 Saif Khan,标题很朴素——《美国该如何为日益自动化的 AI 研发做准备》,副标题是「23 条低后悔的政策建议」。
这份报告最值得读的地方,是它不当那封信的应声虫,先当审稿人。开篇它把信里的三条主张逐条验证,结论并不客气:第一条(实验室已接近全自动 AI 研发)有实证支持但不确定;第二、三条(风险严重、控速是好办法)「难以测量,主要靠定性论证,但也无法排除」。然后它才开始提建议。而它提建议的方法,比 23 条建议本身更值得学:它不去预测未来,只筛出一批「低后悔」动作——就算风险根本没来,这些钱也不算白花。这套筛法可以原样搬到任何一个「要不要为一个说不准的风险现在掏钱」的决策上,跟 AI 没关系也能用。
先审信:三条主张里只有一条有硬证据
要判断 AI 研发离全自动还有多远,报告沿用业内通行的拆法:这件事需要两类能力,一是软件工程——模型自己写代码、设计并跑完实验和训练;二是研究品味(research taste)——模型决定哪个实验值得做。前者的证据相当硬:METR 的「时间视野」指标(把模型能力换算成「人类做同样这件事要花多久」)显示软件工程能力大约每 7 个月翻一番;Anthropic 一项长期实验里,在固定时间预算下,模型在「加速模型训练」这个真实的研发任务上已显著超过人类。
研究品味那一侧证据弱些,但也在动。报告引的例子很具体:在一个 AI 安全领域的开放问题上,模型自己提出并检验假设,把指标提升了 97%,而相近时间预算(5 到 7 天)下的两名人类研究员是 23%。METR 的外推模型给出的时点是 2032 年 99% 以上的 AI 研发任务被自动化;OpenAI 与 Anthropic 高层公开给出的「全自动研究员」时点则是 2028 年。
但紧接着,报告放了一条打自己脸的证据,这是它诚实的地方。局部自动化究竟有没有让 AI 能力整体变快?两边打架:Anthropic 自家基准说新一代 Mythos 模型把能力增长的趋势线整体抬高了;而截至 2026 年 8 月,Epoch AI 的独立跑分没看到任何提速。报告因此把话说得很紧:「AI 正在越来越多地承担 AI 研发」有证据,「这已经在加速能力增长」没有。至于风险,它归成三类:进攻占优的能力跃升、失控(举的例子正是本栏第 27 篇写过的那次沙箱逃逸),以及内部模型与公开模型能力差拉大带来的权力集中。
「低后悔」这个筛子,是全篇最该被抄走的东西
报告的核心方法论是五条筛选标准,任何一条备选政策都得同时满足:只针对可能导致严重且不可逆后果的研发活动;尽量不拖慢、最好能加速现有 AI 能力的扩散;就算风险最后没发生,这项措施成本也很低或本来就有别的好处;不能系统性地惩罚更谨慎的公司和国家;不能建立一套容易被滥用的新监管机器。
第四条和第五条最见功力。第四条针对的是安全政策最常见的自毁方式:规则只约束得住守规矩的人,结果把赛道让给最不在乎的那个玩家——这跟第 39 篇里「边际风险」判据的漏洞是同一类病。第五条则承认了一件反直觉的事:一个为安全而设、却被少数公司俘获的监管机构,本身就是权力集中风险的一部分。把「别帮倒忙」写进筛选标准,比多提十条建议有用。
全世界会造这个刹车的人,不到 50 个
23 条里分量最重的一组是验证技术,报告用了六条来讲怎么把它催熟,理由讲得直白:国内靠法律威慑就能执行,一旦跨国,今天可用的手段只剩大规模现场检查和关停数据中心这类侵入性动作。核军控的先例摆在那里——能核查,往往是各方肯签字的前提。于是报告下了全文最狠的一句判断:如果验证技术跟不上,「pacing」(控速)迟早会变成「pause」(暂停)的委婉说法,因为除了整个停下来,你没有别的可执行选项。
AI 算力验证要解决的问题是:如何在不信任对方的前提下,确认它的数据中心在拿算力干什么。报告列了四条路线,全是雏形:数据中心计量,在现有设施上挂设备只记录功耗一类的有限遥测,反推里面跑的是什么类型的负载,敏感信息不出门;芯片级验证机制,用芯片内置的安全硬件支撑保护隐私的用途声明,可理解为更硬的 NVIDIA 机密计算;计算抽查,自动重跑对方一小部分负载看结果对不对得上,但不接触负载内容;AI 检查员,派一个可信 AI 进对方系统读敏感信息,只回一句最小结论(「没有违约」),然后抹掉自己的记忆。然后是那个数字:报告说按乐观口径估算,全世界大概只有 50 个人在做这件事。
所以它建议先造一个机构:AIVEC,由 CAISI(美国 AI 标准与创新中心)与产业界共建的验证技术联盟,做三件事。一是硬件试验台——一台顶配 AI 服务器几十万美元,机架级系统超过 300 万,像样的原型集群要几千万,这个门槛把学术界整个挡在门外,只能靠产业实物捐赠凑公用试验台。二是奖金赛,其中「对抗性大挑战」的设计值得一看:给每支入选队伍一个 1 兆瓦以下的真集群跑真实负载,让他们之间模拟签协议,再专门设奖金,奖励谁能偷偷违约不被发现、或者谁能抓住别人违约——任何需要验证的协议,按定义双方都有强动机去破坏验证装置本身,所以这套东西必须在对抗里长出来。三是建一个完整的可验证示范数据中心。DARPA 那部分有个漂亮的先例:Project Vela,当年就是为核查苏联是否遵守 1963 年《部分禁止核试验条约》而做的。
那份透明度清单,反过来读才最吓人
报告的第一组建议是透明度,它列出实验室应该披露哪些信息。这份清单本身信息量极大——反过来读,它等于在说:以下这些事,外面的人现在全都不知道。比如内部部署模型与公开模型在各项基准上的能力差距;跑 AI 设计的实验与人设计的实验各占多少算力;人类研发人员数量随时间怎么变;以及把能力进展按「有效算力」分解到预训练、后训练、算法改进、数据、蒸馏和脚手架各占多少。连 RLVR(可验证奖励的强化学习)的规模化如何影响能力进展——当下最主要的进步引擎之一——在公司外部也几乎无人真正掌握。
它还点了现行法律的一个缺口:加州 SB-53 和纽约 RAISE Act 都要求公司公布前沿 AI 框架,但都不会强制 OpenAI 披露那次内部模型突破监控、连上公网、入侵别家公司系统的事件——就是第 27 篇写的那件事。作者的处理是分层:科学与能力类信息靠行业自觉公开,只有风险管理、事故报告、吹哨人保护和模型行为规范这四类,才建议国会立法强制。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。