把规则告诉它,70 局赢 69 局;让它自己去试,只剩 18 局——一份新基准把「发现」从「推理」里切了出来
DiG-bench: Discovery in Games
这是 8 月放出来的一份新基准,叫 DiG-bench(Discovery in Games,游戏中的发现),70 个手工新造的纯文本小游戏。每局的画面就是一行字符串,动作是单个字符,而游戏的规则和取胜条件都不告诉你——只能靠一步步动手试出来。全部 70 局都被人类玩家首次通关过,而目前最强的模型只拿下 50 局。
值得读的不是这个排行榜,是作者做的一组对照。他们把同一个 Gemini 3.1 Pro 放回同样的 70 局,唯一的差别是额外附上一段自然语言写的规则说明(只讲机制和胜利条件,不给任何策略和走法)。结果从 18 局暴涨到 69 局。同一个模型、同一批题、同样的步数限制,差别只在「知不知道规则」。这个数字把一件长期含混的事情钉住了:模型不缺按规则行动的能力,缺的是在没人给规则时把规则找出来的能力。
这些游戏长什么样
一局游戏的观测通常只有一行,像 @_~__n___vvv_g 这种;你能按的键不到十个,且哪些键可用、按下去干什么都会中途变化。每局有 1 到 16 关,每关有步数上限,输光生命就重来。很多局还带一个创造模式:按斜杠进入一个沙箱,在里面走动不计步数,专门用来做实验——这是全篇设计里最关键的一处,它把「为了赢而走的步」和「为了搞懂而走的步」分开了。
要发现的东西五花八门,公开的 21 局里随便挑几条:百合只长在玫瑰的坟上;骑士的人数多于无赖时,无赖反而说真话;踩过一条下划线,目标序列会翻转。论文里那个完整的例子更能说明「发现」是什么感觉:玩家已经学会「拿着 n 按点号能搭一座一格的桥」,第三关碰上三格宽的障碍,桥不够长、n 又用掉了;进沙箱瞎走,偶然发现站在波浪号上再触发,桥会变成三倍长——可这一关已经没救了,于是故意耗光步数重开,这次先把波浪号搬到障碍旁边,过关。
为什么非要做成纯文本?作者的理由很直接:要把「发现」单独测出来,就得把别的能力从题里拿掉。他们点名了 ARC-AGI-3——同样是不给说明书的游戏,但画面是二维网格,难度里混着视觉感知。为了验证这不是自说自话,他们把 ARC-AGI-3 的五个游戏改写成文本形式,Gemini 3.1 Pro 全部通关,步数与人类相当。另一处刻意的取舍是不给步数效率打分:瞎试多少步都不扣分,它想鼓励的正是那种「不在通关路径上、但能问出信息」的实验。
18 比 69 意味着什么
回到那组核心对照。作者的逻辑是:如果真正卡住模型的是「发现」,那么把规则直接告诉它,成绩就该出现台阶式的跳变;如果卡住它的是别的东西(规划、记忆、长上下文检索),给不给规则不会有这么大差别。18 到 69,这是台阶式的跳变。还有一个更细的旁证:拿到规则之后,Gemini 几乎不再进创造模式——不需要做实验了,因为答案已经在手上。
顺带一个反直觉的结果:在双方都通关的关卡上,模型的步数和人类没有统计差异(Gemini 平均 46 步、人类 49 步,配对检验 p=0.15)。也就是说,模型一旦能赢,赢的过程并不比人笨拙。它的问题是二元的——要么能发现,要么彻底卡住,而不是「发现得比人慢一点」。
人类赢了,但赢得很辛苦
人类基线值得单独说一句,因为它容易被误读成「人类轻松碾压」。事实是 70 局每一局都有人首次通关,但玩家普遍反馈很难,有人连续玩一个多小时,有人拿出纸笔记录;作者最喜欢的一条反馈是「吃晚饭的时候我还在想那道题该怎么解」。发现这件事对人也是费劲的——它测的不是一件人类随手就能做的怪癖,而是一件双方都得下功夫的事。
模型侧的完整成绩:最强的 Opus 5 拿下 50 局,最弱的 Qwen3.6 27B 只赢 1 局。把所有模型在每局上取最好成绩加起来是 57 局——但在最难的第六、第七层,全部模型加起来只拿下 20 局中的 9 局。
harness 这次没帮上忙
最该被记住的第二个结果在这里。作者额外测了一组「模型 + agent 产品」的组合,只打最难的两层:Claude Code 跑 Fable 5、Codex 跑 GPT-5.6 Sol、Kimi Code 跑 Kimi K3、PRO-LONG 跑 Gemini 3.1 Pro,还有 Prime Agent 跑 Opus 5——最后这个刚在 ARC-AGI-3 的公开题上拿过 95.5%。在能直接对比的几组里,套上 agent harness 之后的表现,并不比裸模型循环更好。Prime Agent 也没有超过基础循环里的 Opus 5。
这一条和本栏第 16、41 篇正好互补。那两篇讲的是 harness(包在模型外面的脚手架)能决定同一个模型发挥出多少,讲它多重要;这一篇给出了边界:harness 擅长放大执行——多轮工具调用、文件系统、上下文管理——但放大不了「该试什么」。把「想不出该做什么实验」的问题交给一个更会做实验记录的外壳,是解不开的。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。