DuoSteer 无需微调双激活引导,兼顾代码安全与正确性入选 EMNLP
ZiyuYao · x · 2026-09-04
姚子瑜与学生 Hao Yan 的 EMNLP 主会论文《Interpreting and Steering for Safe and Correct Code Generation》:
- 现有 LLM 代码安全缓解方案多把模型当黑盒,作者 inspection 发现它们普遍存在安全-正确性权衡:通过削弱功能让代码"更安全",但也变得不那么有用。
- 论文从机制可解释性角度研究 LLM 如何在代码生成中编码安全与漏洞,发现特定注意力头因果地控制安全与正确性。
- 提出 DuoSteer 双激活引导方法,在这些注意力头上同时引导安全与正确性,无需微调。
- 在 5 个 CWE 类别上评测,DuoSteer 在降低漏洞的同时保持或提升正确性,联合表现优于提示词基线和 SFT。
- 论文已放出 arXiv 版本。
「编程与Agent」频道最新
- GLM-OCR 把乱糟糟 PDF 变本地可检索知识库,四步思路拆解 — ingliguori · 2026-09-04
- Townie 新招:AI 助手可被拉进群聊,自带浏览器独立干活 — soleio · 2026-09-04
- OM2 发布:把企业工具缓存成持久记忆图,砍掉一半重复 token 账单 — SucceededMind · 2026-09-04
- fal 播客第3期:前 AAA 游戏开发者教 UEFN/Roblox 开发者用 AI Pipeline — gorkem · 2026-09-04
- 开发者点赞 Next.js 16.3:体验提升,已有项目实际落地 — jonathan_wilke · 2026-09-04
- Together AI 开源内部客户洞察工具 Open Customer Insights — nutlope · 2026-09-04