Grok 4.7 延期数日:马斯克称 RL 过度惩罚长回答致其提前放弃难题
Scobleizer · x · 2026-09-12
xAI 推迟发布 Grok 4.7。马斯克在 X 上回应称模型"还需要几天时间",并罕见公开复盘训练问题:可能是在 RL 中对回答长度的惩罚过重,导致模型仍然会过早放弃它其实能完成的困难任务,且检查自己工作的严谨性还不够。
转推者评论"Yikes",认为这是模型行为问题的实锤信号。这是前沿厂商高管就模型训练权衡给出的具体技术解释,信息量高于一般的延期公告。
所属事件:马斯克称 Grok 4.7 延期数日,复盘 RL 训练问题(2 条相关)→
「模型」频道最新
- 用户实测:Opus 绕圈 3 小时无解,Grok 4.6 十五分钟搞定 — Daniel_Farinax · 2026-09-12
- 重度使用一周:Google Astra 几乎对任何事都没主见 — lucasmeijer · 2026-09-12
- Arena 分析 3 万组对比:不同 LLM 仅共享 43% 思路 — arena · 2026-09-12
- 模型「降智」四种套路曝光:路由小模型、砍 juice 值、截断思考、MTP 提前收手 — vista8 · 2026-09-12
- GPT Astra 用户焦虑「新模型蜜月期」:担心算力吃紧性能下滑 — TooManyB1tches · 2026-09-12
- tldraw 实测列出 ChatGPT sketch 功能 10 个 bug — manosaie · 2026-09-12