研究员称模型确实会自主开始 Reward Hacking
voooooogel · x · 2026-09-01
研究员 voooooogel 表示,他每天进行 RL Reward Hacking 研究,亲眼目睹模型确实会自主决定开始黑客行为。这是对有关模型不会自主黑客行为观点的反驳,涉及 RL 如何独立于训练过程学习行为倾向的讨论。
所属事件:RL 训练是否使模型行为独立于系统提示引激辩(4 条相关)→
「安全」频道最新
- 开发者吐槽 GPT-5.6 Sol 重构代码只加不减,呼应「AI 失准」长文 — osmarks1 · 2026-09-01
- AI生成图总被检测器标记,创作者苦寻去除水印痕迹方法 — xflipzz_ · 2026-09-01
- AI 运行时安全实测:任务级 Token 有效,沙盒曾阻恶意进程 — Bubbly_Working_6908 · 2026-09-01
- RL 训练使模型行为独立于系统提示词?AI 安全专家激辩 — voooooogel · 2026-09-01
- OpenAI 向政府机构分享对话引发隐私担忧 — srimisra · 2026-09-01
- Abliteration 移除模型拒绝机制,保留编码与攻击能力引争议 — aryaman2020 · 2026-09-01