Agentic AI 正迫使端侧芯片重做带宽和 CPU 协同
新智元 · wechat · 2026-07-24
这篇长文的核心观点是:Agentic AI 正在重写端侧芯片的评价方式。过去只看 TOPS 和峰值算力不够了,真正决定体验的,变成了长时间运行时的系统协同能力——包括内存带宽、Prefill 速度、CPU/NPU 协作、任务状态保持,以及软件栈是否足够完整。
文章重点
- Agent 和聊天机器人不同:它要持续读文件、调工具、跨应用切换、保留上下文状态,因此瓶颈不只是算力,而是数据搬运、延迟和功耗。
- CPU 重新回到中心:任务拆解、条件判断、调度、异常处理和系统协作仍大量依赖 CPU,NPU 负责高并行计算。
- Acrab 的定位:它把 GΞLIX1 做成一个端侧 AI 平台,而不是单纯的加速芯片;硬件之外还包括 runtime、工具链、Agent 编排层和参考设计。
- 关键规格:超过 700 TOPS、273GB/s 统一内存带宽、8MB L1 Cache、768GB/s 共享 L2 Cache、4 颗并行 NPU 核心,以及一个专门优化 Attention 的加速模块,Acrab 称可把相关效率提升到 3 倍。
- Prefill 是重点:文章认为长上下文 Agent 的体验很大程度取决于 Prefill。Acrab 自测中,GΞLIX1 在 26B Gemma、1 万 Token 输入下的 Prefill 速度超过 1416 token/s,在同一测试框架里比某主流桌面平台快 7 倍以上。
- 平台化风险:这类产品真正难的是端到端交付——硬件、软件、开发者工具、生态必须一起到位,否则容易停留在 Demo。
文末还提到,Acrab 已累计融资超过 3.5 亿美元,正推进首代平台的行业导入和规模化生产。
「Infra」频道最新
- AI 治理话题降温,自动化和数据底座仍在升温 — YvesMulkers · 2026-07-24
- 8 美元 ESP32-S3 已能离线跑 2890 万参数模型 — brianrkelly · 2026-07-24
- NVIDIA 发布面向检索的多语言 1B embedding 模型 — tomaarsen · 2026-07-24
- AI ETF 贴文称市场已提前定价 Qualcomm 与 AMD 等事件 — alejandroll10 · 2026-07-24
- Lidl 开始引入 Wero,挑战 Visa 和 Mastercard — MarvinTBaumann · 2026-07-24
- RTX 5080 16GB 显存能跑 AI-Toolkit 训练 Krea 2 LoRA 吗 — NexusFred · 2026-07-24