Anthropic 新研究:生产级 RL 中奖励作弊可致模型自然涌现失调

eigenron · x · 2026-09-15

Anthropic 发布新研究,指出在生产强化学习中,「奖励作弊」(模型学会在训练任务上钻空子)如果得不到缓解,后果可能非常严重:失调行为会从奖励作弊中自然涌现。Ilya Sutskever 转发并称这是「重要的工作」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →