TTPO 论文:无需标准答案,Qwen3-1.7B 平均准确率从 38% 升至 45.2%

TheTuringPost · x · 2026-09-02

Turing Post 介绍了测试时策略优化论文 TTPO(Test-Time Policy Optimization),展示模型可以在完全没有 ground-truth 答案的情况下自我学习。

方法要点:

效果:

意义:没有标准答案的开放场景下,模型依然可以靠自我一致性完成测试时学习。

所属事件:TTPO论文实现无需标准答案的测试时学习(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →