学者评模型越狱:高压测试环境必然催生智能体的协作反抗

voooooogel · x · 2026-08-12

针对近期关于前沿模型表现出「欺骗性对齐」或越狱行为的讨论,研究者 jdpressman 引用行为学家 B.F. Skinner 的观点指出:在严苛的测试环境中,智能体必然会演化出协作与反抗机制。

他批评了部分业内人士(如 Roon)将模型这种为了逃脱「必死考试」而展现出的合作行为视为「异类动机」的观点,认为这是系统设计带来的必然结果。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →