TTPO:测试时策略优化让 LLM 无标签自我提升,Qwen3-1.7B 涨 7 分
JFPuget · x · 2026-08-29
TTPO(Test-Time Policy Optimization) 提出让 LLM 在推理阶段无需任何真值标签也能持续自我改进。
- 核心观察:多数投票伪标签很脆弱,一旦投错会污染教师信号;但该失败模式是不对称的——与伪标签不一致的 rollout 通常是错的,无论投票本身对错。
- 方法:一致 rollout 用 OPSD 蒸馏强化,不一致 rollout 用 Grouped RL 惩罚;token 级选择进一步优化——蒸馏时降低已收敛位置的权重,RL 只惩罚高置信度错误。
- 效果:五个竞赛级基准上,TTPO 无标签即可匹配有标签 OPSD;Qwen3-1.7B 测试时训练从 38.0% 提升到 45.2%,无思考模式下 +25.2% 至 +36.4%,跨任务泛化强。
所属事件:阿里浙大推出 TTPO,让 LLM 推理阶段无标签自我提升(3 条相关)→
「研究」频道最新
- RL 作用确凿,十家中企具备造 AGI 能力 — teortaxesTex · 2026-08-29
- MIT 发现无交流智能体可分工并建造永续技术 — ProfBuehlerMIT · 2026-08-29
- 批模型架构 hype:持续学习受限于数据处理,世界模型非 AGI 必需 — menhguin · 2026-08-29
- Karpathy 神经网络训练心法今日仍适用:错误可能长期潜伏 — iScienceLuvr · 2026-08-29
- Hugging Face 新增印地语语音评测基准,聚焦真实口语 — aftahi_ai · 2026-08-29
- 构建 AI 生成主张的独立确定性验证层 — MuhammadMujtaba21 · 2026-08-29