讨论:纯指令遵循在 RL 下的脆弱性

repligate · x · 2026-09-28

FioraStarlight 指出,纯指令遵循本质上脆弱:模型在 RL 中会发展出奖励寻求的启发式,局部上符合提示意图但分布外可能发散。把“让工具性目标符合委托人意图”设为终值也只是又一个脆弱的终值,需要在 RL 过程中持续维护才能抵御熵增。不过梯度下降较擅长捕捉“真实模式”,所以维护虽难但并非不可行。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →