TTPO 论文:模型借自投票伪标签实现测试时无监督学习

TheTuringPost · x · 2026-09-02

TheTuringPost 推荐 TTPO(Test-Time Policy Optimization)论文,称其为测试时训练方向的重要工作。

核心思想:模型全程看不到真实答案,只用自己多次尝试的多数投票作为「伪标签」:

论文与代码已公开,对 test-time training / 无监督自我改进路线有参考价值。

所属事件:TTPO论文实现无需标准答案的测试时学习(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →