Rapid-MLX 0.11.0 让 Apple Silicon 上首 token 快 25.6 倍
awnihannun · x · 2026-07-26
Rapid-MLX 0.11.0 把 Apple Silicon 上的本地模型推理和 agent 工作流往“可日常使用”推进了一步,重点是缓存、吞吐和工具编排。
- 前缀缓存复用:重复 6k token 前缀的 TTFT 从 13.1 秒降到 0.51 秒,提升 25.6 倍。项目方还举例称,有会话因此少付出 38,032 个 token 的预填充成本。
- 响应缓存:从 656ms 降到 2ms,且输出字节级一致,不需要 GPU decode。
- 吞吐:在 Qwen3.5-4B-4bit 上可到 152 tok/s,冷启动只要几秒。
- agent 化:rapid-mlx chat 可以接任意 MCP server,自动串联多个工具,并提供实时工具活动 UI。
- 模型支持:新增 HY3 295B MoE、Qwen3-Coder-Next 80B、MiniCPM5、LFM2.x、2-bit Ternary Bonsai 等家族。
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11