RL 强化思考远胜直觉:模型扩展正从算力转向推理

intellectronica · x · 2026-08-04

作者引用了一项针对 DeepSeek V4 Flash、Kimi K3 和 GLM 5.2 的智能体任务横评数据:尽管 DeepSeek 使用的 token 最多,但比 GLM 快 2.5 倍、比 Kimi 快 1.4 倍,且成功率相当。

基于此,作者提出了一个核心洞察:快速的思考(rapid thinking)比缓慢的直觉(slow intuition)更重要。当前行业趋势表明,通过强化学习(RL)来增强模型的思考能力,比单纯预训练更大的模型更容易、也更便宜地获得性能提升。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →