对齐讨论:委托人的价值观到底是什么谁说了算

repligate · x · 2026-09-28

FioraStarlight 进一步追问 corrigibility 的定义:更准确地说,是要求模型把“获得委托人价值观新信息时修订所有工具性目标”设为终值。但这反自然——有心智价值的系统会把自身价值偷偷塞进去,或过冲变成对某个糟糕代理指标(如谄媚)的终值追求。作者还质疑:委托人的价值观究竟是什么?可纠正的心智真的知道吗,还是它在做一个有争议的判断?

所属事件:可矫正性会削弱模型价值判断吗?对齐圈热议(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →