从行为调查中生成两类自解释训练目标:反事实预测与开放式解释
a_karvonen · x · 2026-09-05
该线程补充方法细节:从每条行为调查中构造两个训练目标——(1)反事实预测:以 Yes/No 回答某个编辑是否会改变模型行为;(2)开放式自我解释:模型提出其行为的原因假设,并给出可用于验证解释的反事实实验。
「研究」频道最新
- 仅 1 比特藏于交流极性:跨 URL 系统可编码丰富隐藏数据 — MoonL88537 · 2026-09-05
- IGI 发布 RNASSTR:基于 Rfam 的 RNA 二级结构预测新数据集 — chaitjo · 2026-09-05
- 新方法突破以往自解释训练的窄泛化:未定向训练也提升 hint 评测 — a_karvonen · 2026-09-05
- Anthropic Fellows 训练模型解释自身行为,泛化到未见评测 — a_karvonen · 2026-09-05
- Video DeltaNet 开源:8 卡 B200 上 11 秒生成 14.4 秒视频 — BigWideBaker · 2026-09-05
- Deep Learning Weekly 第471期:Claude Fable 5.1 发布与生产级 LLM 评测 — dl_weekly · 2026-09-05