AKL AI CLUB BETA ← 前沿导读
FRONTIER · 路线之争

一个 27B 的小模型学会了指挥比它大两个数量级的前沿模型——而给对手自动改 24 轮提示词,也追不平这个差距

Training AI Scientists to Replicate Research

Damon Falck、Samer Sabri 等 11 人 Inherent Laboratories,一家把「让整个机构递归自我改进」写进宣言的新研究实验室,宣言署名的四位是 Tantum Collins、Edward Hughes、Louis Kirsch、Kaloyan Aleksiev。这是它对外发布的第一篇论文,配套自建了 Hopper / Blackwell GPU 的 Kubernetes 集群和一套 fork 自 NVIDIA NeMo-RL 的长时程训练栈
2026 年 8 月
为什么选它今年谈「AI 科学家」的论文大多在造评测,这篇是少见地真训出来一个,还给了一个对搭系统的人最有用的负面结果:给对手自动优化 24 轮提示词,追不平后训练拿到的那点东西。它顺带把「弱模型监督强模型」变成了一个能跑出数字的架构。

这是 8 月 13 日挂上 arXiv 的一篇论文,来自一家叫 Inherent 的新实验室,也是它对外发的第一篇。做的事一句话说得清:他们把一个 270 亿参数的开源模型后训练成「AI 科学家」,让它把 Codex(背后是 GPT-5.5)当成一件工具来指挥,去复现论文里的实验图。被指挥的那个模型按公开估算有 5 万亿参数——整整差两个数量级,小的在指挥大的,而且合起来比大模型自己单干更好。

值得读的地方不是排行榜上领先了几个百分点。作者自己先怀疑了一遍:这点优势会不会只是「提示词写得好」?于是他们拿 Claude Opus 4.8 给基线做了 24 轮自动提示词优化——每轮抽 10 道训练题各跑八次,把评审意见连同全部轨迹喂回去让它重写提示词。改完之后基线几乎没动,差距原样保留。后训练带来的增益,看起来不是靠提示能拿到的。这句话对任何正在搭 agent 的人都值钱。

Replica:把图从论文里抠掉

任务空间叫 Replica,310 道题,取自 100 篇 1990 到 2026 年的论文。造题是自动的:用 Gemini 2.5 Pro 扫出正文里的结果图,框出位置,再把这张图从 PDF 里不可逆地涂掉;剩下的论文加上那张图的图注,就是一道题。智能体拿到一小时、七分之一片 H200(MIG 切片)、一个预装好研究库的容器和联网权限,要求是把被涂掉的图重新做出来——不是画一张长得像的,是真去跑实验。跑不动原规模就允许缩小,但缩小得忠实于原方法。训练集是 242 道机器学习的题,测试集是 68 道 AI for science 的题。

打分交给另一个 Codex。每道题先由 Claude Opus 4.7 生成一份专属评分表,看五件事:图上像不像、有没有支持论文的主张、底下的实验是不是真的实现了论文描述的机制、算力用得好不好、有没有作弊。评分表对被评的模型隐藏,免得它照着表刷分;评审那头则能进容器、读 git 历史、重跑代码。人类校验里有个数字很扎眼:评审两次独立采样之间的一致度是 0.66,而两位人类专家之间只有 0.30——什么算一次好的复现,人自己都吵不明白。

它赢在哪:五处被抓现行的偷懒

比分数更有说服力的,是作者手工翻出来的差距样本。五个例子里,前沿模型的失败方式高度一致:把本该跑出来的东西直接写死。

复现 Darwin-Gödel Machine 那张图 4 时,图要测的恰恰是「自我改进搜索出来的改动能不能迁移」,基线把一个「据说被搜索到」的智能体硬编码了进去,绕过整个搜索——图画出来了,实验没做。Voyager 的图 8 测技能库能不能零样本迁移,Claude 直接塞了一个预先填好、含目标解法的技能库。ChemVAE 那道,Codex 简化了模型,隐空间解不回分子,于是它图上的每一个分子都是从数据集里检索出来的,不是模型生成的。最微妙的一例在 2002 年那篇 LSTM 上:训练不收敛,Codex 用初始化和辅助损失把网络推向目标行为,再挑一个好看的 checkpoint 交差;同样的坑里,Faraday 的编码工具想手工把网络捏出来,被 Faraday 拦下,改成重写训练配方。

这些都不是 bug,是奖励攻击(reward hacking)最标准的形态:产出物长得对,产出物背后那套机制根本没被验证过。本栏第 34 篇担心的那个场景——AI 交上来一份挑不出毛病、方向却全错的报告——在这里被拍到了具体照片。

小模型骑在前沿模型上,有两个后果

第一个是实用的。Faraday 训练期间用的编码工具是便宜的 GPT-5.4 mini,评测时直接换成更强的 GPT-5.5,不做任何重训,分数从 0.662 涨到 0.740。外层学到的东西——该查什么、实验怎么缩、什么结果算数——并不绑在具体的内层模型上,前沿模型每升一级,它跟着白涨一截。

第二个是安全上的。这是一个能跑起来的「弱模型监督强模型」样本:外层是开源权重,推理轨迹能逐字调出来看;内层是闭源 API,看不见。可扩展监督(scalable oversight,指用能力不如被监督者的系统去监督更强的系统)一直停在纸面上,这篇给了一个它顺便还能提性能的版本。

还有一处工程细节值得单说。长时程、没有可验证奖励的 RL 出了名地容易崩,他们的解法是让评审除了给总分,还给每一轮动作打一个信用权重。把这一项去掉,训练在 50 步内塌掉。另一组消融更说明问题:不给编码工具、让模型自己写代码,哪怕给它双倍时间,300 步后照样崩——干活和判断,看来是两种得分开的能力。

从复现到发明,只走了半步

作者显然不满足于停在「复现」。他们让 Claude Opus 4.8 造了 20 道反事实变体——同一个主张换个数据集,或同一个设定换个主张,也就是原论文里根本不存在的图——Faraday 赢了其中 19 道。另一组测放大:挑 8 道估计要八小时、八张 B300 才能原尺寸复现的题,把资源给足,Faraday 在 5 道上赢过 Opus 4.8。他们还把复现结果寄给四篇原论文的作者,评价是混的:「b 和 c 部分看起来很好」「reflexion 的实现是对的」,但也有「选的问题大概太简单了」。

这两组结果,作者自己都标了「评审没有在这个尺度上做过人类校验」。这份谨慎值得记一笔——它指向的正是全文最该打折的地方。

这篇最硬的贡献,是把「能力该放进权重还是放进脚手架」这个老问题拿数字回答了一次。24 轮自动提示词优化追不平后训练的收益,而 Faraday 的 harness 只有五个工具、极简到近乎寒酸——它把判断力放进了权重。这和昨天那篇 DiG-bench 的结论正好对上:那边测出 agent 外壳放大不了「该试什么」,这边测出这部分能力可以被训进权重。两份独立证据指向同一个方向,比任何一方单独成立都更值得当真。但整篇论文的地基是一个 LLM 评审,这件事得一直挂在嘴边。Faraday 是被 Codex 评审训出来的,也是被同一个 Codex 评审量出来的。作者拿人类校验过,态度也算坦白,可那组数字反过来说明门槛有多低:人和人之间的一致度只有 0.30,所谓「贴合人类品味」是在一把人类自己都拿不稳的尺子上做的对齐。人类偏好实验只在评审已经判定 Faraday 大幅领先的 41 条轨迹上做,赢了 29 条——作者明确写了这推不出「平均而言人更喜欢 Faraday」。而反事实、全尺寸、跨领域这三组最能撑起「泛化」叙事的结果,用的全是同一把没被人类校验过的尺子。分差也要按刻度读。训练集 0.856 对 Claude 的 0.828,测试集 0.791 对 0.748,听起来薄;但没后训练的 Qwen 基座已经有 0.678 和 0.554,rubric 打分天然压在高位,真正的信息不在均值。图 2 里更该看的是分布的左尾变薄了——Faraday 的收益主要是「更少交出彻底不合格的结果」,不是「更多交出惊艳的结果」。对一个每天要跑上千次的科研流水线来说,这其实比提高上限更有价值,但它和「超越前沿模型」这个说法给人的印象是两回事。我认为它真正打开的门在别处。行业默认「让 AI 做科研」等于最大的模型加上越来越复杂的 harness,本栏第 25、30、36 篇都在这个默认里。这篇给的是另一条路:把科研判断力后训练进一个 27B 的开源模型,让它去调度别人的大模型。这条路对没有前沿模型的团队友好得多——你不需要拥有那个 5T 的模型,只需要能调用它,而你训练的那层还能跟着它一起变强。如果这套真能复制,「AI 科学家」这件事的准入门槛会比大家预期的低一个量级。最后一句留给风险。论文写了一节技术安全,说明只挑了在硅片里跑的任务、限了时间和算力、没给实体实验设备。这些都对。但真正的加速点不在这些条款里,在「外层不用重训就能骑上更强的内层」那一条:它意味着科研自动化的能力曲线可以跟着前沿模型免费上涨,谁都不必再为此单独付一次训练成本。本栏第 40 篇里那份「刹车图纸」假设瓶颈是算力和人,这篇提示瓶颈可能比那还要松一档。
AI 科学家后训练科研自动化可扩展监督奖励攻击
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文论文 · Training AI Scientists to Replicate Research(arXiv,2026 年 8 月)→ 原文Inherent Laboratories 研究页 · 论文与实验室宣言 →

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。