TTPO 论文:无需标准答案,Qwen3-1.7B 平均准确率从 38% 升至 45.2%
TheTuringPost · x · 2026-09-02
Turing Post 介绍了测试时策略优化论文 TTPO(Test-Time Policy Optimization),展示模型可以在完全没有 ground-truth 答案的情况下自我学习。
方法要点:
- 模型从不看到真实答案,只把自己多次尝试的多数投票结果当作伪标签
- 与多数意见一致的解被视为可能有用,不一致的被视为可能有错——但不惩罚整个解,只惩罚其中最可疑的 token
- 这种非对称处理降低了「强化错误答案」的风险,比把多数答案当作绝对正确更稳健
效果:
- Qwen3-1.7B 平均准确率从 38.0% 提升到 45.2%,全程不使用答案标签
- 方法可跨数学 benchmark 迁移,说明模型学到的不只是单个数据集的答案
意义:没有标准答案的开放场景下,模型依然可以靠自我一致性完成测试时学习。
所属事件:TTPO论文实现无需标准答案的测试时学习(2 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03