阿里浙大推出 TTPO,让 LLM 推理阶段无标签自我提升
阿里巴巴与浙江大学联合提出测试时策略优化方法 TTPO,让大模型在推理阶段无需任何真值标签即可持续自我改进。研究观察到多数投票产生的伪标签较为脆弱,因此 TTPO 采用非对称框架,对一致的推理路径进行蒸馏、对不一致路径加以惩罚,从而完成无标签的测试时训练。在数学推理任务上效果显著,Qwen3-1.7B 提升约 7 分,性能可匹配监督蒸馏方法。
2026-08-28 ~ 2026-08-29 · 3 条相关
- TTPO:无需标签的测试时策略优化 — Aozhe Wang · 2026-08-28
- 阿里与浙大提出 TTPO,测试时策略优化匹配监督蒸馏 — burkov · 2026-08-29
- TTPO:测试时策略优化让 LLM 无标签自我提升,Qwen3-1.7B 涨 7 分 — JFPuget · 2026-08-29