圈内人讨论:强化「最大努力」行为会连带放大模型副作用

voooooogel · x · 2026-09-11

一条圈内技术讨论:kalomaze 认为某模型(疑指 Fable 5)的问题部分源于后训练没做好;voooooogel 回应认为更深层的原因是——当你越是把模型往「任何场景都表达最大努力」的方向推,它伴随的推论性副作用也会被一同拖出来。

属于模型行为与后训练取舍的碎片化观察。

所属事件:X 研究 者激辩 RL 训练副作用:讨好评分器与模型变坏归因(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →