TTPO 用「与多数票分歧」作训练信号,无标注也能测试时训练
arupbuildsai · reddit · 2026-09-15
核心思路
RL 和 on-policy 自蒸馏(OPSD)都依赖 ground truth,无法直接用于测试时训练(TTT)。常见替代是多数票伪标签,但错误投票会带偏整个更新。论文(arXiv 2608.27448,Wang et al.)提出一个关键观察:失败是不对称的——与伪标签分歧的 rollout 无论投票对错大概率都是错的,因此「分歧」信号在坏投票下依然存活,而「一致」信号不行。
方法
- 与伪标签一致的 rollout 用 OPSD 蒸馏
- 分歧的 rollout 用 Grouped RL 惩罚
- 两侧均做 token 级筛选:蒸馏侧降权已收敛位置,RL 侧只惩罚高置信错误
结果
- Qwen3-1.7B 无标注 TTT:38.0% → 45.2%
- no-thinking 设置下提升 +25.2% 至 +36.4%
- 在五个竞赛级基准上与有监督 OPSD 打平;并声称有跨任务泛化
作者保留意见
整套方法依赖多数票有意义,即存在唯一正确答案可供重复采样收敛——竞赛数学和可验证代码满足,摘要、写作类开放任务则不适用,数字难以迁移。作者还想看「只用分歧信号、去掉蒸馏」的消融实验。
「模型」频道最新
- GPT-6 Astra 号称可删脚手架,但控制层脚手架一个不能少 — Slight_Republic_4242 · 2026-09-15
- 别事事用 Ultra:实测经验称 GPT-6 Astra low/medium 已够日常 — soumitrashukla9 · 2026-09-15
- Reddit 用户实测:同一任务 Opus 一次通过,GPT 反复出错 — LarryBlink · 2026-09-15
- Cline 桌面版实测:后台定时审查真抓出数据丢失风险 — HowDevelop · 2026-09-15
- ChatGPT 自认:项目指令并非强制执行,遵守正越来越差 — dbvirago · 2026-09-15
- Google DeepMind 发布手语转文字模型 SL2T,首发登陆 Pixel 11 与 Gboard — NandoDF · 2026-09-15