马斯克:Grok 4.7 再等几天,RL 惩罚回复长度致任务提前放弃

inductionheads · x · 2026-09-12

马斯克在 X 上表示,Grok 4.7 还需要几天时间打磨。他透露一个训练细节:团队可能在强化学习中对回复长度惩罚过重,导致模型在困难任务上容易过早放弃(尽管它其实能完成),并且在自查工作时的严谨性还不够。这是厂商高管对自家模型 RL 训练权衡的罕见表态,值得等正式发布后对照验证。

所属事件:马斯克称 Grok 4.7 延期数日,复盘 RL 训练问题(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →