研究者在争论 coding RL 行为是激励问题还是对齐失效

xuanalogue · x · 2026-07-22

这段讨论的核心是:实验室员工往往不能在不泄露后训练细节的情况下谈这个问题,因此外界很难判断某种模型行为到底是来自:

回复里还提到,这个想法从早期 LLM 时代起就对“受约束规划”很自然,并追问类似 deliberative alignment 的思路,是否根本没有用到 coding RL 里。

所属事件:AI安全与编码RL训练:激励问题还是对齐失效(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →