PyroDash:小模型按需呼叫大模型,推理成本降96%反超单独用大模型
jiqizhixin · x · 2026-09-22
Pyromind 发布 token 级小-大模型协同推理框架 PyroDash。
- 核心思路:不是简单路由到贵的大模型,而是让 4B 小模型在 token 粒度上自主决定何时向大模型求助,平均每 100 个问题才调用一次大模型。
- 训练方式:用强化学习训练,奖励 = 准确率 − λ × 归一化成本(绝对成本除以全用大模型的基线);配套 EasyHard-24k 数据集作为训练场。
- 结果:输出价格低至 $0.08/百万 token(顶级模型约 $75),推理成本降低 96%,且在五个数学推理 benchmark 上表现优于单独使用大模型。
- 作者观点:RL 不只用于提升单个模型能力,也能训练整个系统学会分工,在质量与成本间找到平衡。
「Infra」频道最新
- 纯 C 零依赖引擎 COLIBRI:让消费级硬件跑 2.8T 参数 MoE 模型 — bibryam · 2026-09-22
- Sentdex 实测:openjev 在 GB10 延迟 169ms,3090 上 137ms — Sentdex · 2026-09-22
- Underdog 推出 Husky 推理引擎,MacBook 上跑出 730 tokens/s — jimmykoppel · 2026-09-22
- peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练 — simonguozirui · 2026-09-22
- Cloudflare Python Workers 结束两年预览正式可用 — Simon Willison · 2026-09-22
- 应对 AI 爬虫流量:Turnstile 之外的 Cloudflare AI Labyrinth 方案 — fforres · 2026-09-22