免标签测试时强化学习:只调10万bias参数,Qwen2.5-7B达76.67%
OLAResearchX · hf · 2026-10-01
Label-free bias-only TTRL
- TTRL 让模型无需标注数据提升推理,但现有方法需优化大量参数。本文证明:奖励信号与优化空间都严重受限时,有效的测试时适应仍能涌现。
- 方法:用多数投票伪标签作奖励,只优化约 10 万个 bias 参数,预训练主干完全冻结。
- 效果:Qwen2.5-7B 在 MATH-500 达 76.67%,略超带标注的 bias-steering 复现,参数量比全参数 TTRL 少 7.6 万倍。
- 泛化:同一流程改善 MathVista、AI2D、LogicVista、MMAU 等视觉与音频推理任务;学到的 steering 向量可迁移到 4500 道未见 MATH 题。
- 机理分析:多数投票可靠性随 rollout 共识提升;可访问梯度能量更大的 bias 子空间可训练性更强。
「研究」频道最新
- RAG 已死?0.6B 小模型 BlockSearch 挑战百万 token 检索 — CShorten30 · 2026-10-01
- 让模型「愿对评估者说实话」的 eval-cooperative 训练获奖 — dhadfieldmenell · 2026-10-01
- 0.8B 小模型加 9 个 LoRA,agent 决策快 38 倍且更准 — Usual_Maximum7673 · 2026-10-01
- 首个 AI 发现的抗癌药物宣告见效 — theimposingshadow · 2026-10-01
- NeurIPS 新基准 MedKIT:LLM 记住新知识≠真正会用 — zeynepakata · 2026-10-01
- 作者回应:SynthID Bio 水印仅测于 AlphaFold 3 但有望泛化 — davidstutz92 · 2026-10-01