新方法突破以往自解释训练的窄泛化:未定向训练也提升 hint 评测

a_karvonen · x · 2026-09-05

作者指出,以往的自我解释训练泛化范围很窄(如只从一种 hint 格式泛化到另一种),因为数据集太窄。他们的训练从未针对 hint,但两个模型在 held-out 的 hint 评测(「移除 hint 会不会改变你的回答?」)以及其他评测上都有提升。

所属事件:自解释训练新突破:跨模型迁移且泛化更广(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →