KAIST FlyBy 框架教小模型识别知识瓶颈,4B 以更低成本超 Qwen3-14B
kaist-ai · hf · 2026-09-29
KAIST AI 发布论文《Knowing When Thinking Is Not Enough》,研究小推理模型(sRM)何时该继续思考、何时该向外求助。
核心发现:在中间推理状态做干预实验后发现,自我反思(self-refinement)基本只是把概率质量集中到当前状态已可达的解上,并不能让新解变得可达。由此划分出两种失败模式:
- 执行瓶颈:正确路径可达,反思可以救回;
- 知识瓶颈:需要模型参数之外的外部信息才能到达。
FlyBy 框架:训练 4B/8B 模型先推理、再诊断未解决部分,遇到知识瓶颈时向更强模型发起选择性查询。用监督微调引导多深度查询动作,再用成本感知 RL 校准是否查询、问什么、花多少钱。
成绩:在 6 个基准共 1,158 道难题上,FlyBy-4B pass@8 达 45.96%,超过 Qwen3-14B 的 41.64%,服务成本仅其 1/2.7;pass@1(16.85% vs 15.31%)也超过 Qwen3-8B;FlyBy-8B pass@8 进一步提升到 51.81%。
「模型」频道最新
- 曝 OpenAI「dot」设备新细节:举到耳边即可对话 ChatGPT 语音 — koltregaskes · 2026-09-29
- Google 将于 11 月 17 日用 Skills 取代 Gemini Gems — mark_k · 2026-09-29
- 开源工具 Carla:本地跑 llama.cpp 造「AI 角色」的织机实验室 — max_paperclips · 2026-09-29
- 爆料称 OpenAI DevDay 新品是 Grok 机器人与 Meta Muse 的翻版 — gaganghotra_ · 2026-09-29
- 高帧率运行让 Jev 成为真正的 System 1:每次点击都传完整状态 — mathemagic1an · 2026-09-29
- 爆料称 OpenAI 新模型命名候选流出:Dots、Orbit、o — mark_k · 2026-09-29