PyroDash 让 4B 小模型自己决定何时求助:成本降至三十分之一

机器之心 · wechat · 2026-09-13

Pyromind 开源的 PyroDash 是一种成本感知、token 级的大小模型协同推理范式:小模型(如 Qwen3.5-4B)优先生成,判断自己接不住时发出控制 token τoff,由协同引擎把已生成的推理轨迹打包交给冻结的大模型(如 GLM-5.2)单向续写完成,一个请求至多一次大模型调用。训练分三阶段:控制 token 嵌入学习、行为冷启动 SFT、成本感知 GRPO 对齐,奖励为准确度减去 λ 倍归一化成本(含小模型 token 计入大模型 prefill 的双重计费)。在五个数学基准上,省钱配置下成本从 49.36 美元降到 1.78 美元(约 1/30),准确率仅降 3 个点;重准确率配置下平均 64.04%,反超纯大模型的 57.68%,成本还低两成,且优于 RouteLLM、GlimpRouter 等路由基线。论文:arXiv:2607.20327,数据集 EasyHard-24k 已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →