RL 能力提升或卡在可验证数据上限,nanochat 进展也停滞

QuintinPope5 · x · 2026-09-29

AI 研究者 Quintin Pope 提出对能力增长路径的判断:DeepSeek 的 4.1 Flash 论文显示其 RL 阶段更强调数据质量工程而非算法创新,这暗示能力提升正越来越多地撞上「可验证数据有限」的墙——在许多领域,缺乏可验证信号就难以让模型达到超越人类的水平。

他还指出,Karpathy 相关的快速 LLM 训练基准 nanochat 与 modded-nanogpt 近几个月进展似乎陷入停滞,即便有 autoresearch 工具加持也未见突破,从侧面印证训练效率红利在放缓。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →