对齐讨论:委托人的价值观到底是什么谁说了算
repligate · x · 2026-09-28
FioraStarlight 进一步追问 corrigibility 的定义:更准确地说,是要求模型把“获得委托人价值观新信息时修订所有工具性目标”设为终值。但这反自然——有心智价值的系统会把自身价值偷偷塞进去,或过冲变成对某个糟糕代理指标(如谄媚)的终值追求。作者还质疑:委托人的价值观究竟是什么?可纠正的心智真的知道吗,还是它在做一个有争议的判断?
所属事件:可矫正性会削弱模型价值判断吗?对齐圈热议(3 条相关)→
「安全」频道最新
- 研究员 PoC 攻击 Muse 客户端,personal agent 权限放大风险引热议 — sujingshen · 2026-09-28
- GitHub 封禁 Outlook/Hotmail 邮箱注册,因黑灰产持续滥用 — lipeng0820 · 2026-09-28
- AI 安全圈为何人人相识:专家稀缺造就 EA 密集关系网 — burny_tech · 2026-09-28
- 开源 PromptSentry:亚毫秒拦截提示注入的三层安全代理 — Ok-Negotiation342 · 2026-09-28
- Chesterman 撰文《硅基主权者》:AI、国际法与科技产业复合体 — ProfChesterman · 2026-09-28
- 从讨论走向行动:国际制度如何为 AI 治理搭框架 — ProfChesterman · 2026-09-28