对齐研究者辩论:模型「理解指令却不上做」才是真正的风险

dioscuri · x · 2026-09-27

一条关于对齐概念的技术辩论。dioscuri 表示其担忧主要在沟通层面:人们听到「目标错了」会理解为「误解了指令」(「LLM 不是很擅长理解吗?」),因此想传达的真正风险是系统能理解指令却不追求执行它们,并认为性与繁殖的类比在这里很有用。

xuanalogue 回应:前沿模型显然有独立于外层优化器的习得优化算法——即作为目标导向搜索的 CoT——所以多数担忧其实在于它们是否内化了错误的目标/倾向,原概念可能已被此事实消解。

所属事件:mesa优化是否仍是传达AI风险的关键概念引发辩论(6 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →