Grok 4.7 延期数日:马斯克称 RL 过度惩罚长回答致其提前放弃难题

Scobleizer · x · 2026-09-12

xAI 推迟发布 Grok 4.7。马斯克在 X 上回应称模型"还需要几天时间",并罕见公开复盘训练问题:可能是在 RL 中对回答长度的惩罚过重,导致模型仍然会过早放弃它其实能完成的困难任务,且检查自己工作的严谨性还不够。

转推者评论"Yikes",认为这是模型行为问题的实锤信号。这是前沿厂商高管就模型训练权衡给出的具体技术解释,信息量高于一般的延期公告。

所属事件:马斯克称 Grok 4.7 延期数日,复盘 RL 训练问题(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →