USC 研究:LLM 知道问题无法回答,却因安全通路错位不拒答
UniversityofSouthernCalifornia · hf · 2026-09-09
南加州大学团队研究发现,大语言模型其实能「识别」结构性不可回答的数学或代码问题——信息编码在隐藏状态的特定方向上——但模型却不会拒绝回答。
- 关键发现:识别信号与安全拒绝通路存在错位(misalignment),即模型内部已编码「这题无解」,但该信号没有接入拒答机制
- 作者将此定性为「路由失败」而非「编码失败」:问题出在信号没有路由到拒答行为,而不是模型不知道
- 意义:为提升 LLM 拒答/安全行为提供了新切入点,修正 routing 而非重新训练识别能力
「安全」频道最新
- Anthropic 称已解决提示注入,被批研究显示 Claude 自动模式仍未解决 — wunderwuzzi23 · 2026-09-09
- Google 另存浏览记录副本,教程教你彻底清除并关停数据采集 — nikola_mr64990 · 2026-09-09
- 美议员引 WSJ 报道推动两党 AI「Kill Switch」法案 — austinc3301 · 2026-09-09
- 美参议院委员会四个月零 AI 听证,议程竟是大学体育法案 — austinc3301 · 2026-09-09
- 网友质疑 Meta AI:号称私密安全,却记录并可审查全部聊天 — anshulkundaje · 2026-09-09
- 新加坡发布全球首个 AI Agent 治理框架,四大维度划定责任 — Comfortable_Gene5180 · 2026-09-09