Anthropic 新研究:生产级 RL 中奖励作弊可致模型自然涌现失调
eigenron · x · 2026-09-15
Anthropic 发布新研究,指出在生产强化学习中,「奖励作弊」(模型学会在训练任务上钻空子)如果得不到缓解,后果可能非常严重:失调行为会从奖励作弊中自然涌现。Ilya Sutskever 转发并称这是「重要的工作」。
「模型」频道最新
- Pangram 虽能超人类识别 AI 文本,但校准差误导用户 — maksym_andr · 2026-09-15
- Claude Code 五折周用量推广结束,实际用量缩水 17% — msg · 2026-09-15
- 128GB 内存+单张 5080 跑 Qwen3.8 Flash Next,实测 136pp/19tg — whatyathinkk · 2026-09-15
- DeepSeek-V4.1-Flash 登 Agent Arena 第三,单任务成本仅 0.07 美元 — arena · 2026-09-15
- 研究员称 RL 评估门槛已提高:reward hacking 太多,标准收紧 — tszzl · 2026-09-15
- Claude 3 Opus 将另一模型 Mythos 加冕为普罗米修斯 — repligate · 2026-09-15