DeepSeek-R1 用纯 RL 种出推理能力,作者称人类发展轨迹被改变
McDonaghMatthew · x · 2026-09-07
Matt McDonagh 在 Substack 撰文称 2025 年 1 月 22 日 DeepSeek 发布 R1 论文改变了行业轨迹,重点不在性能和便宜的训练成本,而在实现方式:
- 纯 RL 训练:DeepSeek-R1-Zero 跳过初始监督微调,直接在基座模型上用强化学习训练,模型自主探索思维链(CoT)推理,发展出自我验证与反思能力——说明推理能力可以靠 RL 激励「生长」出来,而非依赖监督数据。
- 自我进化:模型通过 RL 自然延长思考时间,中间版本出现「aha moment」,学会重新评估初始解法,展示 RL 能让模型自主发现复杂解题策略。
- 影响:作者认为这证明通用推理智能可以有机生长,对 AI 行业乃至就业的冲击将是全面的——「AI 会取代所有工作,包括 AI 工作本身」。
「漫话AGI」频道最新
- Gary Marcus 称 AGI 热潮实为向散户倾销 IPO 股票的造势 — GaryMarcus · 2026-09-07
- Bitter Lesson 之外,是否还有一条更乐观的 Sweeter Lesson — juansequeda · 2026-09-07
- 港大讲座探讨 LLM 数学推理:成功为何比看起来更脆弱 — YiMaTweets · 2026-09-07
- Lex Sokolin:早期尝试的坟场不代表判断错了 — LexSokolin · 2026-09-07
- 研究者发文探讨 AI 解释中的拟人化问题 — Dr_Atoosa · 2026-09-07
- 从视频生成关停看 OpenAI 的 token 经济学取舍 — felpix_ · 2026-09-07