SAKIKO 审计框架揭示:行为改变不等于工具调用 LLM 的内部修复

UniversityofBirmingham · hf · 2026-10-02

伯明翰大学团队提出 SAKIKO,一个对使用工具的 LLM 内部干预做机制审计的框架,正式化「表征修复」的判定:方向性误差发现、基于路由的条件干预、目标解析验证与前瞻性冻结的统计许可。

主要发现

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →