Reddit 玩家把闲置 NPU 用起来:70W 平板跑 125B MoE 替代 95% 云端调用
stereohype · reddit · 2026-10-08
一位 Strix Halo 用户用 Halogen 提供的 NPU 端点,给 pi 编码 agent 配了一套 NPU 加速的副工具链,跑本地 Qwen3.8 Flash-Next(125B MoE,64 tok/s 解码,0.03s 首 token),自称可替代约 95% 的云端大模型调用,最难的少数任务仍交给 GLM 5.3 或 Opus。
核心数据
- 同一 bug 修复任务:NPU 搜索版 13.6 分钟 vs 无 NPU 18.7 分钟
- 相同 pi harness 下横向对比 7 个模型:Flash-Next 以 2m55s 最先给出完整答案(journalctl 追踪到 notify-send 竞态并找到上游 PR),甚至胜过 max 档的 753B GLM 5.3(6m15s)
- NPU 承担的四类工作:文件搜索(0.1s/次,20 题实测 15/20 胜 ripgrep 的 9/20)、重复文件扫描(8.4s 找出 45 对)、决策分流(0.8B 模型 120ms,78% 准确)、prompt injection 筛查(0.7s/条,召回 42%,零误报)
- 194k 会话压缩:sidecar 摘要 50s vs 主模型 166s,97% 缓存命中
诚实的部分:NPU 并没有让推理变快,GPU 仍是主力;它改变的是 token 花在什么地方。全套本地化,262k 上下文,代码不出本机。作者附带 GitHub 仓库与七份模型对比文档。
「编程与Agent」频道最新
- Agent 框架皆为拐杖?真正关键是最小权限的行动授权框架 — andreisavu · 2026-10-09
- 让员工写 Markdown 教 agent 干活?工人不愿配合:隐性知识被白抽走 — mattbeane · 2026-10-08
- 全用 Claude Opus 5.5 写的《辐射:纽约》浏览器版,零贴图零音效文件 — chrisfirst · 2026-10-08
- 判断何时值得交给 AI agent:重复出现的五分钟任务才值得自动化 — gethackteam · 2026-10-08
- 孩子沉迷 Spotify 短视频,家长派 Agent 造 ESP32 播放器省订阅费 — natesiggard · 2026-10-08
- AI Agent 撞上数据库:80% 库由 Agent 创建,又爱删生产库 — mattturck · 2026-10-08