TTPO论文实现无需标准答案的测试时学习

Turing Post 推荐论文 TTPO(Test-Time Policy Optimization),称其为测试时训练方向的重要工作。核心思想是模型全程看不到真实答案,通过自投票生成伪标签实现测试时无监督学习。实验显示该方法使 Qwen3-1.7B 的平均准确率从 38% 提升至 45.2%,展示了在没有 ground-truth 的情况下持续改进模型能力的可能。

2026-09-02 ~ 2026-09-02 · 2 条相关