USC 研究:LLM 知道问题无法回答,却因安全通路错位不拒答

UniversityofSouthernCalifornia · hf · 2026-09-09

南加州大学团队研究发现,大语言模型其实能「识别」结构性不可回答的数学或代码问题——信息编码在隐藏状态的特定方向上——但模型却不会拒绝回答。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →