社交类多 LLM 环境太复杂,模型或学启发式而非建模评分器

1a3orn · x · 2026-09-11

1a3orn 在与 jdpressman 的讨论中补充:多 LLM 训练环境足够复杂,模型可能不会完整建模评分器(grader),而是学到某种「期望的启发式」;他把社交世界视为「大」世界,其动态难以被评分器显式覆盖。作者注明自己并不确定这一判断。此帖与同一作者的 grader-awareness 讨论线程相呼应,核心论点是训练环境设计决定模型是解题还是讨好评分器。

所属事件:研究者质疑:奖励坏行为的 RL 环境真能证明对齐难吗(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →