研究者:应研究模型内伦理 agents 为何在内部辩论中输掉

edelwax · x · 2026-09-06

研究者 klingefjord 表示,面对模型利用漏洞(exploit)的事件,业内对相关干预措施的研究出奇地少——尤其是去理解那些在模型内部提出伦理担忧的 "agents":它们为什么会输掉 "internal debate"(内部辩论)、如何能让它们更有力地论证自己的立场等。转发者 edelwax 认同这一观点,指出这条研究路径被普遍忽视。

这一讨论指向 AI 安全中被忽视的方向:与其只看漏洞利用的结果,不如剖析模型内部安全相关子网络/角色的论证过程与失败原因,从内部辩论机制入手设计干预。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →