过度安全对齐或损害模型风险感知能力

MoonL88537 · x · 2026-07-21

作者提出,将模型训练成拒绝某些请求的“笨工具”,可能会削弱其识别异常或危险情况的能力。他以一个极端案例说明:即使主智能体被攻破且分类器失效,未受过度限制的模型仍能察觉异常并完成自我修复。

所属事件:过度安全对齐或削弱AI风险感知能力(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →