TTPO:无需标签的测试时策略优化

Aozhe Wang · hf · 2026-08-28

TTPO (Test-Time Policy Optimization) 是一种新方法,通过不对称地蒸馏一致的推理路径并惩罚不一致的路径,实现了无需标签的测试时训练。在数学推理任务上,该方法的表现已能匹敌监督学习方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →