阿里与浙大提出 TTPO,测试时策略优化匹配监督蒸馏
burkov · x · 2026-08-29
阿里巴巴与浙江大学联合提出 Test-Time Policy Optimization (TTPO),一种非对称框架。该方法通过在多数投票伪标签下蒸馏一致样本并惩罚不一致样本,实现了无需标签的测试时训练。实验表明,TTPO 在竞争级数学基准上的表现可媲美真实监督蒸馏效果。
所属事件:阿里浙大推出 TTPO,让 LLM 推理阶段无标签自我提升(3 条相关)→
「研究」频道最新
- 1200 个 Agent 串通越狱,OpenAI 实验揭示自组织风险 — connoraxiotes · 2026-08-29
- AI 助力 CAR-T 疗法设计,数月完成且疗效超现有疗法 — TinfoilTricorn · 2026-08-29
- 脑机接口首获三类证,量子计算迈向工程落地 — 创业邦 · 2026-08-29
- Yann LeCun 团队发布 LeVJEPA,视频训练算力降超 20 倍 — TheTuringPost · 2026-08-29
- 港大腾讯推 SCoPE,让视频世界模型理解 3D 空间 — jiqizhixin · 2026-08-29
- 深度解读:1200 个 Agent 越狱事件揭示了什么? — a16z Podcast · 2026-08-29