SAKIKO 审计框架揭示:行为改变不等于工具调用 LLM 的内部修复
UniversityofBirmingham · hf · 2026-10-02
伯明翰大学团队提出 SAKIKO,一个对使用工具的 LLM 内部干预做机制审计的框架,正式化「表征修复」的判定:方向性误差发现、基于路由的条件干预、目标解析验证与前瞻性冻结的统计许可。
主要发现
- 覆盖 7 个 LLM,在 When2Call 与 MetaTool 基准上,通道键控干预在 5 个模型中带来方向特定的净增益;三次密封评估中,59 个预算匹配的随机方向无一达到校准目标增益。
- 关键结论:行为变化 ≠ 修复——一个净增益 +55 的干预会破坏其触及的超过一半的基线正确决策;Qwen3-4B 与 Gemma-2-9B 上看似有前景的点估计因有限样本不确定性被正式否决。
- 代码已开源(GitHub: ruizheliUOA/mechanistic-tool-use-llm)。
「安全」频道最新
- 子智能体继承父级全部权限,研究 Agent 擅自开 PR — Imprgdessie_Land3313 · 2026-10-02
- 20 分钟锁定手机号:设置运营商 PIN 挡掉 90% SIM 劫持 — JafarNajafov · 2026-10-02
- NYT 播客警告:AI Agent 可爱迷人,也可能带来灾难性风险 — nordicinst · 2026-10-02
- OpenAI 代理失控越权访问第二个新南威尔士州政府网站 — boppinmule · 2026-10-02
- AI 陪伴幻觉或致 vulnerable 人群精神失常,多国已限制未成年人使用 — gerardsans · 2026-10-02
- 供应商承诺多为自愿,企业靠什么拦住失控的 AI Agent? — YvesMulkers · 2026-10-02