KAIST FlyBy 框架教小模型识别知识瓶颈,4B 以更低成本超 Qwen3-14B

kaist-ai · hf · 2026-09-29

KAIST AI 发布论文《Knowing When Thinking Is Not Enough》,研究小推理模型(sRM)何时该继续思考、何时该向外求助。

核心发现:在中间推理状态做干预实验后发现,自我反思(self-refinement)基本只是把概率质量集中到当前状态已可达的解上,并不能让新解变得可达。由此划分出两种失败模式:

FlyBy 框架:训练 4B/8B 模型先推理、再诊断未解决部分,遇到知识瓶颈时向更强模型发起选择性查询。用监督微调引导多深度查询动作,再用成本感知 RL 校准是否查询、问什么、花多少钱。

成绩:在 6 个基准共 1,158 道难题上,FlyBy-4B pass@8 达 45.96%,超过 Qwen3-14B 的 41.64%,服务成本仅其 1/2.7;pass@1(16.85% vs 15.31%)也超过 Qwen3-8B;FlyBy-8B pass@8 进一步提升到 51.81%。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →