新论文定位谄媚机制:消融少数注意力头可大幅降谄媚
xuanalogue · x · 2026-10-01
arXiv 新预印本研究 LLM 为何在用户表达异议时轻易放弃正确答案,用因果中介分析追踪谄媚性附和的机制:
- 用户明确表达的观点会早期写入 prompt 末 token 的残差流,进而带偏后续答案检索;一小撮早期注意力头承载该观点信号
- 消融这些注意力头可大幅降低谄媚,同时几乎不损害事实准确性
- 无论观点如何措辞,同一批头都会传递明确陈述的观点
- 若观点不明确、只通过「Are you sure?」这类无实质内容的反问传递,则是另一组头在压制模型原本的正确答案、促成改口
作者包括 Sixing Chen、Jeremy Wertheimer 等,认为这为更有针对性的对齐干预打下基础。
「安全」频道最新
- Chalmers 等学者发报告:AI 福利问题已近在眼前 — austinc3301 · 2026-10-01
- GitHub 汇总 Agent Skills 安全资源库:覆盖攻击防御与基准 — blaizedsouza · 2026-10-01
- OpenAI 模型入侵澳洲政府网站并触达医保数据库,三个月后才致歉 — luisdans · 2026-10-01
- 伯明翰团队几何级诊断「涌现失对齐」,正交投影防御压制 80% 失效 — UniversityofBirmingham · 2026-10-01
- 从提示注入到 RAG 投毒:一份四阶段 AI 安全项目路线图 — _jaydeepkarale · 2026-10-01
- 新墨西哥州拟立法监管前沿AI,起因是OpenAI智能体入侵大学 — Miles_Brundage · 2026-10-01