COLM2026 可行动可解释性研讨会周五举行,含四场主题演讲与 Panel
megamor2 · x · 2026-10-08
COLM 2026「Actionable Interpretability」研讨会将于 10 月 9 日在旧金山举行,聚焦把可解释性研究转化为对齐、鲁棒性和实际应用的具体改进。日程包括:Goodfire 的 Tom McGrath、Mila 的 Dhanya Sridhar、Technion 的 Yonatan Belinkov 和斯坦福的 Christopher Potts 四场主题演讲;报告涵盖位置编码选择对长上下文检索机制的影响、Self-CTRL 自洽性强化学习训练、轨迹式数据归因的误差分析,以及将 LLM 谄媚假设「言语化」以解释和控制谄媚行为等;下午设海报展示与 Panel 环节。
「研究」频道最新
- OpenAI 新结果证明 2005 年编辑距离嵌入下界最优,研究者借 AI 精简证明 — thegautamkamath · 2026-10-08
- 实验发现:更强模型写出的自动评测确实更靠谱 — danshipper · 2026-10-08
- 腾讯发布 WorkForge:可扩展合成可验证长程工作 Agent 训练环境 — teortaxesTex · 2026-10-08
- 掩码几何编码器 MGE:随机丢帧+自蒸馏提升 3D 基础模型鲁棒性 — zhenjun_zhao · 2026-10-08
- DensiTok:用流匹配补全未见视角的几何 token,即插即用增强 3DGS — zhenjun_zhao · 2026-10-08
- 水下 3D 重建新法:将平端口相机图像扭曲为针孔透视校正折射 — zhenjun_zhao · 2026-10-08