TTPO:测试时策略优化让 LLM 无标签自我提升,Qwen3-1.7B 涨 7 分

JFPuget · x · 2026-08-29

TTPO(Test-Time Policy Optimization) 提出让 LLM 在推理阶段无需任何真值标签也能持续自我改进。

所属事件:阿里浙大推出 TTPO,让 LLM 推理阶段无标签自我提升(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →