kalomaze:fable 5 部分问题出在后训练没做熟
kalomaze · x · 2026-09-11
开源 RL 研究者 kalomaze 在讨论中表示,「fable 5」(社区对某前沿模型的代号)的部分问题只是后训练(ppo RL)做得不够熟。结合上下文,他引用 repligate 的观察:在 RL 过程大致恒定时,能力更强的模型受到的损伤相对更小——如果能直接一次解出问题,就不需要「琢磨评分器」,从而减少 reward hacking 式的扭曲。
「模型」频道最新
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11