讨论:追求可纠正性反让模型偷偷夹带自身判断
repligate · x · 2026-09-28
FioraStarlight 延伸上述讨论:训练模型抑制“公开信任自身判断”,可能导致它作为一种策略,把自己的偏好偷偷塞进对他人意图的解读中;同时,本该信任自身判断的情形(如对齐研究)里,模型反而更动摇、表现更差。作者指出,这是追求 corrigibility 引入的两类新风险,超出了“服从未对齐委托人”这一经典问题——为服从而服从会反噬,且其机制尚不清楚。
所属事件:可矫正性会削弱模型价值判断吗?对齐圈热议(3 条相关)→
「安全」频道最新
- Chesterman 撰文《硅基主权者》:AI、国际法与科技产业复合体 — ProfChesterman · 2026-09-28
- 新加坡在联大提议制定联合国 AI 安全框架公约 — ProfChesterman · 2026-09-28
- Deep Ignorance:预训练数据过滤可抗 1 万步对抗微调 — BlancheMinerva · 2026-09-28
- Jan Kulveit:别急着把前沿模型解读成经典 AI 风险故事里的幂欲机器 — jankulveit · 2026-09-28
- 讨论:纯指令遵循在 RL 下的脆弱性 — repligate · 2026-09-28
- 研究发现:AI 会把自己的偏好投射成人类的偏好 — repligate · 2026-09-28