TTPO:无需标签的测试时策略优化
Aozhe Wang · hf · 2026-08-28
TTPO (Test-Time Policy Optimization) 是一种新方法,通过不对称地蒸馏一致的推理路径并惩罚不一致的路径,实现了无需标签的测试时训练。在数学推理任务上,该方法的表现已能匹敌监督学习方法。
「研究」频道最新
- LLM Agent 评估综述:构建二维分类框架与企业落地挑战 — kalyan_kpl · 2026-08-28
- 用 60 行 TS 构建科幻电影 RAG 智能体 — mastra_ai · 2026-08-28
- 2026 年 AI 系统 Danus 复现复杂拟阵理论证明,机器可写完整论文 — maier_ak · 2026-08-28
- 复现 Recirculation:Gemma 3 无需微调 PPL 降 23% — CatAstro_Piyush · 2026-08-28
- 研究员呼吁 AI 会议应亏本运营以补贴青年学者 — 3scorciav · 2026-08-28
- 南大提出 HCL:不微调模型也能让 Agent 持续学习 — 机器之心 · 2026-08-28