马斯克称 Grok 4.7 延期数日,复盘 RL 训练问题
马斯克在 X 上宣布 xAI 的 Grok 4.7 还需要几天时间才能发布。他罕见公开复盘训练细节,称团队可能在强化学习中对回复长度的惩罚过重,导致模型在困难任务上容易过早放弃,尽管这些任务它其实有能力完成。目前团队正在针对该问题进行打磨调整。
2026-09-12 ~ 2026-09-12 · 2 条相关
- 马斯克:Grok 4.7 再等几天,RL 惩罚回复长度致任务提前放弃 — inductionheads · 2026-09-12
另有 1 条近重复转述:Scobleizer