Rapid-MLX 0.11.0 让 Apple Silicon 上首 token 快 25.6 倍
awnihannun · x · 2026-07-26
Rapid-MLX 0.11.0 把 Apple Silicon 上的本地模型推理和 agent 工作流往“可日常使用”推进了一步,重点是缓存、吞吐和工具编排。
- 前缀缓存复用:重复 6k token 前缀的 TTFT 从 13.1 秒降到 0.51 秒,提升 25.6 倍。项目方还举例称,有会话因此少付出 38,032 个 token 的预填充成本。
- 响应缓存:从 656ms 降到 2ms,且输出字节级一致,不需要 GPU decode。
- 吞吐:在 Qwen3.5-4B-4bit 上可到 152 tok/s,冷启动只要几秒。
- agent 化:rapid-mlx chat 可以接任意 MCP server,自动串联多个工具,并提供实时工具活动 UI。
- 模型支持:新增 HY3 295B MoE、Qwen3-Coder-Next 80B、MiniCPM5、LFM2.x、2-bit Ternary Bonsai 等家族。
「编程与Agent」频道最新
- 网友设6个月倒计时,验证 Anthropic CEO 软件工程自动化预言 — Aizkmusic · 2026-07-26
- Python依赖管理神器:uv实测大幅提升安装速度 — IgorBrigadir · 2026-07-26
- 作者用 Claude 先加载上下文,让 agent 像第二大脑一样工作 — evielync · 2026-07-26
- 有人已经让 AI agent 连续跑上数周到数月 — ycombinator · 2026-07-26
- 讨论称 AI 工程师应按风险分层审代码,而非死守立场 — altryne · 2026-07-26
- nslookup MCP 服务器:赋能 AI 进行 DNS 查询与安全扫描 — modelcontextprotocol · 2026-07-26