COLM2026 可行动可解释性研讨会周五举行,含四场主题演讲与 Panel

megamor2 · x · 2026-10-08

COLM 2026「Actionable Interpretability」研讨会将于 10 月 9 日在旧金山举行,聚焦把可解释性研究转化为对齐、鲁棒性和实际应用的具体改进。日程包括:Goodfire 的 Tom McGrath、Mila 的 Dhanya Sridhar、Technion 的 Yonatan Belinkov 和斯坦福的 Christopher Potts 四场主题演讲;报告涵盖位置编码选择对长上下文检索机制的影响、Self-CTRL 自洽性强化学习训练、轨迹式数据归因的误差分析,以及将 LLM 谄媚假设「言语化」以解释和控制谄媚行为等;下午设海报展示与 Panel 环节。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →