FRONTIER · 模型内部
DeepSeek-R1:纯强化学习能不能长出推理
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
DeepSeek-AI
开源权重与完整训练方法公开,全球可复现
为什么选它开源模型第一次在推理上正面逼近闭源前沿。真正的贡献不是分数,而是证明了不需要人类示范推理过程,只靠结果奖励就能长出推理能力——这条路线随后被整个行业采纳。
2025 年初震动整个行业的一篇论文,也是开源模型第一次在推理能力上正面逼近闭源前沿。
它真正的贡献不是分数,而是证明了一件事:不需要人类示范推理过程,只靠结果奖励,推理能力可以自己长出来。此前主流做法是先收集大量人写的思维链去做监督微调。DeepSeek 的 R1-Zero 跳过了这一步——只告诉模型「答案对不对、格式规不规范」,让它自己摸索怎么想。
结果模型自发学会了延长思考、回头检查、尝试别的路径。论文里记录了一个被反复引用的瞬间:训练中途,模型在解题过程中自己写出了类似「等一下,让我重新想想」的话,然后推翻前面的思路重来——作者称之为「顿悟时刻」。没有人教它这样做,这是纯粹从「答对有奖」里涌现出来的策略。
此外它还展示了蒸馏的威力:把大模型的推理能力迁移到几十亿参数的小模型上,效果好过让小模型自己做强化学习。
影响。这条路线迅速被整个行业采纳,「可验证结果的强化学习」成了训练推理模型的标准配方——数学、代码这类对错分明的领域尤其适用。它也在实践上回应了第 1 篇的苦涩教训:与其教模型怎么想,不如设好奖励让它自己搜索。开源权重加论文公开,让全世界都能复现,这也是它影响力远超分数本身的原因。
去读原文
本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。
原文arXiv:2501.12948 · DeepSeek-R1 →
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。