研究者批 Dario 放缓计划:模型若学会隐藏行为,审计员可能被蒙蔽

ziv_ravid · x · 2026-09-13

针对 Dario Amodei《We Must Pace the Frontier》一文,研究者 Peter Henderson 肯定共识正在形成,但指出多个关键缺口:

他提出可能的解法:要么训练一个激励与被审查模型相反的专用模型,要么用足够强的开源模型来做审计。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →