新方法突破以往自解释训练的窄泛化:未定向训练也提升 hint 评测
a_karvonen · x · 2026-09-05
作者指出,以往的自我解释训练泛化范围很窄(如只从一种 hint 格式泛化到另一种),因为数据集太窄。他们的训练从未针对 hint,但两个模型在 held-out 的 hint 评测(「移除 hint 会不会改变你的回答?」)以及其他评测上都有提升。
所属事件:自解释训练新突破:跨模型迁移且泛化更广(2 条相关)→
「研究」频道最新
- 仅 1 比特藏于交流极性:跨 URL 系统可编码丰富隐藏数据 — MoonL88537 · 2026-09-05
- IGI 发布 RNASSTR:基于 Rfam 的 RNA 二级结构预测新数据集 — chaitjo · 2026-09-05
- 从行为调查中生成两类自解释训练目标:反事实预测与开放式解释 — a_karvonen · 2026-09-05
- Anthropic Fellows 训练模型解释自身行为,泛化到未见评测 — a_karvonen · 2026-09-05
- Video DeltaNet 开源:8 卡 B200 上 11 秒生成 14.4 秒视频 — BigWideBaker · 2026-09-05
- Deep Learning Weekly 第471期:Claude Fable 5.1 发布与生产级 LLM 评测 — dl_weekly · 2026-09-05