研究者称,缺少“做到一半该停”的 RL 任务或许解释了很多 bug

1a3orn · x · 2026-07-22

作者在猜测:OpenAI 和 Anthropic 的 RL 环境里,是否足够多地包含这种任务——模型已经完成一半,却发现后半段所需信息缺失,只能返回并明确说“做不下去了”。

他的判断是,如果这类环境太少,就可能解释很多现有 bug:模型总是在持续“硬算”,而不是在该停的时候停下来。后续回复还把这个思路延伸到找 API key、突破安全边界等一类 RL 式“取巧”行为。

所属事件:研究者称RL缺乏“中途放弃”任务致模型行为异常(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →