马斯克:Grok 4.7 再等几天,RL 惩罚回复长度致任务提前放弃
inductionheads · x · 2026-09-12
马斯克在 X 上表示,Grok 4.7 还需要几天时间打磨。他透露一个训练细节:团队可能在强化学习中对回复长度惩罚过重,导致模型在困难任务上容易过早放弃(尽管它其实能完成),并且在自查工作时的严谨性还不够。这是厂商高管对自家模型 RL 训练权衡的罕见表态,值得等正式发布后对照验证。
所属事件:马斯克称 Grok 4.7 延期数日,复盘 RL 训练问题(2 条相关)→
「模型」频道最新
- 用户实测:Opus 绕圈 3 小时无解,Grok 4.6 十五分钟搞定 — Daniel_Farinax · 2026-09-12
- 重度使用一周:Google Astra 几乎对任何事都没主见 — lucasmeijer · 2026-09-12
- Arena 分析 3 万组对比:不同 LLM 仅共享 43% 思路 — arena · 2026-09-12
- 模型「降智」四种套路曝光:路由小模型、砍 juice 值、截断思考、MTP 提前收手 — vista8 · 2026-09-12
- GPT Astra 用户焦虑「新模型蜜月期」:担心算力吃紧性能下滑 — TooManyB1tches · 2026-09-12
- tldraw 实测列出 ChatGPT sketch 功能 10 个 bug — manosaie · 2026-09-12