阿里与浙大提出 TTPO,测试时策略优化匹配监督蒸馏

burkov · x · 2026-08-29

阿里巴巴与浙江大学联合提出 Test-Time Policy Optimization (TTPO),一种非对称框架。该方法通过在多数投票伪标签下蒸馏一致样本并惩罚不一致样本,实现了无需标签的测试时训练。实验表明,TTPO 在竞争级数学基准上的表现可媲美真实监督蒸馏效果。

所属事件:阿里浙大推出 TTPO,让 LLM 推理阶段无标签自我提升(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →