论文代码开源:定位并干预大模型有害响应机制

boknilev · x · 2026-08-27

关于“大语言模型通过共享机制生成有害响应”的研究已开源代码。项目包含 B-TAP(因果追踪),这是一种可解释性方法,用于定位关键权重并进行因果干预。该研究揭示了不同类型有害行为背后的统一机制,并提供了干预工具。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →