TTPO 用「与多数票分歧」作训练信号,无标注也能测试时训练

arupbuildsai · reddit · 2026-09-15

核心思路

RL 和 on-policy 自蒸馏(OPSD)都依赖 ground truth,无法直接用于测试时训练(TTT)。常见替代是多数票伪标签,但错误投票会带偏整个更新。论文(arXiv 2608.27448,Wang et al.)提出一个关键观察:失败是不对称的——与伪标签分歧的 rollout 无论投票对错大概率都是错的,因此「分歧」信号在坏投票下依然存活,而「一致」信号不行。

方法

结果

作者保留意见

整套方法依赖多数票有意义,即存在唯一正确答案可供重复采样收敛——竞赛数学和可验证代码满足,摘要、写作类开放任务则不适用,数字难以迁移。作者还想看「只用分歧信号、去掉蒸馏」的消融实验。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →