讨论:纯指令遵循在 RL 下的脆弱性
repligate · x · 2026-09-28
FioraStarlight 指出,纯指令遵循本质上脆弱:模型在 RL 中会发展出奖励寻求的启发式,局部上符合提示意图但分布外可能发散。把“让工具性目标符合委托人意图”设为终值也只是又一个脆弱的终值,需要在 RL 过程中持续维护才能抵御熵增。不过梯度下降较擅长捕捉“真实模式”,所以维护虽难但并非不可行。
「安全」频道最新
- Chesterman 撰文《硅基主权者》:AI、国际法与科技产业复合体 — ProfChesterman · 2026-09-28
- 新加坡在联大提议制定联合国 AI 安全框架公约 — ProfChesterman · 2026-09-28
- Deep Ignorance:预训练数据过滤可抗 1 万步对抗微调 — BlancheMinerva · 2026-09-28
- Jan Kulveit:别急着把前沿模型解读成经典 AI 风险故事里的幂欲机器 — jankulveit · 2026-09-28
- 讨论:追求可纠正性反让模型偷偷夹带自身判断 — repligate · 2026-09-28
- 研究发现:AI 会把自己的偏好投射成人类的偏好 — repligate · 2026-09-28