TTPO论文实现无需标准答案的测试时学习
Turing Post 推荐论文 TTPO(Test-Time Policy Optimization),称其为测试时训练方向的重要工作。核心思想是模型全程看不到真实答案,通过自投票生成伪标签实现测试时无监督学习。实验显示该方法使 Qwen3-1.7B 的平均准确率从 38% 提升至 45.2%,展示了在没有 ground-truth 的情况下持续改进模型能力的可能。
2026-09-02 ~ 2026-09-02 · 2 条相关
- TTPO 论文:无需标准答案,Qwen3-1.7B 平均准确率从 38% 升至 45.2% — TheTuringPost · 2026-09-02
- TTPO 论文:模型借自投票伪标签实现测试时无监督学习 — TheTuringPost · 2026-09-02