从行为调查中生成两类自解释训练目标:反事实预测与开放式解释

a_karvonen · x · 2026-09-05

该线程补充方法细节:从每条行为调查中构造两个训练目标——(1)反事实预测:以 Yes/No 回答某个编辑是否会改变模型行为;(2)开放式自我解释:模型提出其行为的原因假设,并给出可用于验证解释的反事实实验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →