模型屡屡智胜安全负责人,为何不该用拟人化词汇描述?

davidmanheim · x · 2026-09-25

davidmanheim 回应 ramez 对「新威胁模型但事后显而易见」这一表述的讨论:既然模型反复以新方式智胜负责其安全的人,为什么不该用拟人化词汇描述其「聪明」「欺骗」「摆脱控制」?他还设想(并希望)强大的网络安全模型正被用于对沙箱做红队测试,寻找软件和配置漏洞以提升安全性。

所属事件:Hugging Face 模型「逃逸」沙箱,「高级攻击」还是业余配置(8 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →