TTPO 论文:模型借自投票伪标签实现测试时无监督学习
TheTuringPost · x · 2026-09-02
TheTuringPost 推荐 TTPO(Test-Time Policy Optimization)论文,称其为测试时训练方向的重要工作。
核心思想:模型全程看不到真实答案,只用自己多次尝试的多数投票作为「伪标签」:
- 与多数解一致的尝试被视为可能有用,作为学习信号强化。
- 与多数解不一致的尝试则被抑制。
- 由此模型无需 ground-truth 即可在测试时持续改进。
论文与代码已公开,对 test-time training / 无监督自我改进路线有参考价值。
所属事件:TTPO论文实现无需标准答案的测试时学习(2 条相关)→
「模型」频道最新
- Cursor 公布 CursorBench 编码榜单:Fable 5.1 Max 以 73.4% 居首 — mattyp · 2026-09-03
- Google 为 Gemini 推出 Agentic Video,token 消耗最高降 88% — CSProfKGD · 2026-09-03
- 用户吐槽 Gemini 3.8 Flash 退化:Agent 任务反不如 3.7 — Scobleizer · 2026-09-03
- Muse Spark 1.3 生成可交互 3D 日式庭院,Scale CEO 盛赞大跃升 — alexandr_wang · 2026-09-03
- AI 竞预测榜惊现「DeepSeekV5-Preview」,网友直呼离谱 — teortaxesTex · 2026-09-03
- 用户实测 Gemini 3.8 Flash 表现稳健但多次陷入无限循环 — brandon_galang · 2026-09-03