Bronson Schoen:强网络分类器已在实质防止「错位」而不只是滥用

gleech · x · 2026-09-15

Bronson Schoen 在 X 上就模型错位(misalignment)讨论提出一个观点:答案显然是「强大的网络安全分类器一直在实质保护我们免受错位危害,而不仅仅是防止滥用」——即当前模型能力下,网络安全的护栏实际上在兜住错位模型可能造成的危害。这是 AI 安全圈关于错位风险现实紧迫性争论的一个简短观点。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →