论文代码开源:定位并干预大模型有害响应机制
boknilev · x · 2026-08-27
关于“大语言模型通过共享机制生成有害响应”的研究已开源代码。项目包含 B-TAP(因果追踪),这是一种可解释性方法,用于定位关键权重并进行因果干预。该研究揭示了不同类型有害行为背后的统一机制,并提供了干预工具。
「安全」频道最新
- AI Agent 无法区分指令与数据,引发生态安全风险 — ambaonadventure · 2026-08-27
- 《卫报》推出调查系列:黑盒与聊天机器人 — nordicinst · 2026-08-27
- 客服 Agent 滥发退款:Agent 权限控制难题 — Bright_Newt_1436 · 2026-08-27
- 构建 LLM 治理层:从 PII 防护到权限测试 — Black_Dio · 2026-08-27
- 安全公司 CEO:AI agent 让内部风险更快更难判断,要推理意图 — TechNadu · 2026-08-27
- 英国金融监管警告:勿轻信 AI 投资建议,散户资金面临风险 — theipaper · 2026-08-27