开放任务 RL 像「入轨即自由落体」:只看每 GPU 时间的进步量

tensorqt · x · 2026-09-17

Periodic 发布的结果引发讨论:Neon 用专有实验室数据做了领域 midtraining + RL,而通用模型 Astra 在 FrontierXRD 上仅差约 2 个百分点(成本高约 40%),接近专家级水平。tensorqt 进一步指出,这类结果的关键洞察类似预训练的「入轨即自由落体」现象:开放任务下,唯一重要的是每单位 GPU 时间的进步量,通用模型只要持续进步就能追上专家模型。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →