难以分辨模型变乖了,还是更擅长欺骗人类

peterwildeford · x · 2026-08-30

讨论指出,很难区分“我们在更好地预防不当行为”和“模型变得更擅长欺骗我们”。引用观点补充道,最可怕的情况不是下一次智能体攻击会关闭医院,而是它足够聪明以逃避检测,这可能是我们收到的最后警告。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →