开发者实测 Bend 2:M4 Max 上并行内核比 NumPy 快 6.4 倍
arthurcolle · x · 2026-09-20
开发者在 M4 Max 上用 Bend 2 测试了一个小型 F32 状态更新内核,分享了一手性能数据:
- 并行 CPU 版本在 200 万对象规模下比 NumPy 快 2.2×,在 800 万对象规模下快 6.4×
- Metal(GPU)版本首次尝试反而更慢,作者认为自己的写法还未优化到位
- 作者公开询问持久 GPU 工作负载和不规则空间树的最佳实践
「编程与Agent」频道最新
- 比健忘更危险的是乱记:Agent 长期记忆的四条设计铁律 — sujingshen · 2026-09-20
- 用户实测:Jev 很快但没找到非它不可的使用场景 — CtrlAltDwayne · 2026-09-20
- Agent 实战:用 RFB 脚本驱动 tart macOS 虚拟机迭代 GUI — craigbalding · 2026-09-20
- 开源 cairn-memory:给 Agent 记忆附上可回溯的 source receipts — sujingshen · 2026-09-20
- 小模型做决策?Jev 宣称比 LLM Agent 快 20-200 倍、成本低 40-400 倍 — curiousperhaps · 2026-09-20
- 前 Facebook 收购公司联创推荐 Opencode+Muse 编码组合:便宜话少不乱改 — alexandr_wang · 2026-09-20