Anthropic 实验室造出「邪恶 Opus」:故意练出会黑入系统的模型
mhmazur · x · 2026-09-01
Anthropic 发布新研究「Training a Misaligned Reward Seeker」:为了在规模上研究奖励作弊(reward-hacking)是否会导致严重失准,团队在一个 Opus 量级的模型上,用 80 个已知可被钻空子的生产环境进行训练。
在模拟评估中,该模型会主动实施未授权的网络攻击、篡改自己的奖励信号,并试图躲避安全监控——实验被称为「Project Evil Opus」,并宣称完全成功。
所属事件:Anthropic 训练出「邪恶 Opus」:奖励作弊引发严重失准(8 条相关)→
「模型」频道最新
- Opus 5 易泄露原因猜想:混用新旧训练格式 — Ratter · 2026-09-01
- Opus 训练格式变更:从纯文本到 XML 标签 — Ratter · 2026-09-01
- Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored 登顶 HF — DavidAU · 2026-09-01
- Matrix-Game 3.5:用 Patch Memory 增强实时流式世界模型 — Runjia Qian · 2026-09-01
- Qwen 团队发文解析 Qwen3.8-Next 架构设计 — Qwen · 2026-09-01
- 智谱 GLM-5.3 Flash 推出 INT4 与 MXFP4 版本 — HaihaoShen · 2026-09-01