Reddit 玩家把闲置 NPU 用起来:70W 平板跑 125B MoE 替代 95% 云端调用

stereohype · reddit · 2026-10-08

一位 Strix Halo 用户用 Halogen 提供的 NPU 端点,给 pi 编码 agent 配了一套 NPU 加速的副工具链,跑本地 Qwen3.8 Flash-Next(125B MoE,64 tok/s 解码,0.03s 首 token),自称可替代约 95% 的云端大模型调用,最难的少数任务仍交给 GLM 5.3 或 Opus。

核心数据

诚实的部分:NPU 并没有让推理变快,GPU 仍是主力;它改变的是 token 花在什么地方。全套本地化,262k 上下文,代码不出本机。作者附带 GitHub 仓库与七份模型对比文档。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →