FRONTIER · 模型内部
思考的幻觉
The Illusion of Thinking
Shojaee 等
Apple 机器学习研究 · 2025 年争议最大的一篇
为什么选它2025 年吵得最凶的一篇。收录它不是因为结论正确——反驳相当有力——而是因为那个真正有用的发现活了下来:存在一个复杂度阈值,越过后性能是断崖式崩塌,你无法从简单任务的表现推断复杂任务的可靠性。
2025 年吵得最凶的一篇论文。苹果的研究者给推理模型出了一批经典逻辑谜题(汉诺塔、过河问题等),好处是难度可以精确调节。结果发现了三个区间:简单任务上,普通模型反而比推理模型好;中等难度上,推理模型显出优势;而难度越过某个点之后,两者的准确率一起崩到零。
最反直觉的是崩溃时的表现:模型并没有「拼命想但想不出来」,而是随着题目变难,它花在推理上的 token 反而减少了——像是提前放弃。更尴尬的是,即使直接把正确算法写在提示里让它照着执行,它照样在同一个复杂度上崩掉。
反驳来得很快,而且有力:有人指出部分题目所需的步骤数已经超出模型的输出长度上限,所谓「放弃」其实是被 token 预算掐断;也有人指出某些过河题在给定参数下根本无解,模型拒答反而是对的。
该怎么看这场争论。反驳确实削弱了「模型不会推理」这个强结论,但削不掉那个真正有用的发现:存在一个复杂度阈值,越过它性能不是缓慢下降而是断崖式崩塌——而你无法从简单任务上的良好表现,推断它在复杂任务上的可靠性。对任何要把 AI 放进生产流程的人,这一条比论文的标题重要得多。
去读原文
本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。
原文Apple ML Research · The Illusion of Thinking →
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。