COLM 2026 可解释性工作坊公布 71 篇接收论文与海报列表
ChrisGPotts · x · 2026-10-09
COLM 2026「Actionable Interpretability」工作坊公布接收结果:71 篇论文入选,分两个海报场次展示,其中 4 篇为口头报告,海报已可在线查阅。入选题目覆盖可解释性多个前沿方向,包括:
- 转向与机制分析:转向向量不可辨识性、Guardrail Vectors 双向转向及其安全失效、LangFIR 稀疏语言特定特征发现
- 幻觉定位:针对 LLaVA 物体幻觉背后的注意力头进行定位
- 模糊测试探行为:用 fuzzing 引出大模型隐藏行为
- 潜在推理模型可解释性(Sarah Wiegreffe 参与)、音频语言模型上下文故障的定位与修复等
对关注 mech interp 与模型安全的研究者是不错的选题风向标。
「研究」频道最新
- Simons 研究所 2027 秋启动扩散模型与流学期项目,博士后招募开启 — giannis_daras · 2026-10-10
- 前 OpenAI Operator 研究员展示真实世界 RL 高精度任务训练成果 — ZhaoMandi · 2026-10-10
- 斯坦福 Mulligan:瞄准失败初始状态采数据,2550 次盲评超越均匀采集 — ZhaoMandi · 2026-10-10
- 随机对照试验:AI 当辅导老师提升成绩并持续,代写则一周后效果消退 — emollick · 2026-10-10
- Nvidia 发布 ARC:不加新数据不改架构,机器人推理成功率提升 5 倍 — arankomatsuzaki · 2026-10-10
- 警惕 AI 解释出错:归因分数校验法 Captum 误差达 1,Tangermeme 仅 10⁻⁷ — bravo_abad · 2026-10-10