高通称 NPU 延迟优势让端侧 AI Agent 更实用
qdrant_engine · x · 2026-07-28
高通的 Alan Zhu 在 Vector Space Day SF 上强调:端侧 AI 最大、也最容易被低估的优势,不只是成本和隐私,而是延迟。
他把同一个 agentic search 任务分别跑在三种算力路径上:
- NPU:几乎即时响应
- GPU:约 12 秒
- CPU:约 30 秒,而且设备发热后还会继续降速
他还指出,NPU 在整段会话里能以 90 tokens/s 稳定运行,温度约 37°C。这意味着本地 AI agent 不只是“理论上可行”,而是已经接近实用:可以离线检索成千上万个本地文件,并在几秒内给出带引用的答案。
「编程与Agent」频道最新
- x402 Builder Codes 让应用和智能体路由需求也能分成 — kleffew94 · 2026-07-28
- Claude Code 创始人称创业机会在未被产品化的模型能力 — ycombinator · 2026-07-28
- 同一模型规格,不同 coding agent 给出差异估计 — JessicaHullman · 2026-07-28
- 渐进式上下文扩展更适合线性注意力混合模型 — stochasticchasm · 2026-07-28
- Codex 自动化每小时盯房源,先一步抢到旧金山公寓 — nickbaumann_ · 2026-07-28
- 租 GPU 加开源模型,让 AI 月账单从 120 万降到 10 万 — kimmonismus · 2026-07-28