128GB 笔记本本地跑 Qwen3.8 做 Agent 编码,思考 token 才是耗时瓶颈
deepu105 · reddit · 2026-09-11
作者在 ASUS ROG Flow Z13(Ryzen AI Max+ 395、128GB 统一内存、Arch Linux)上用 llama.cpp 后端 + 自研 LlamaStash + Pi 编码框架跑 Qwen 3.8(27B 与 Flash Next),认为可替代 Claude Opus 4.6–4.8 做 agentic coding,代价是任务耗时 2–3 倍。
- 质量在线:Flash Next 在 Artificial Analysis 指数得 40(Opus 4.8 为 42);27b(xhigh)得 34,超过 Opus 4.6 的 32。27b 曾在大型 Rust 代码库上一次通过整个功能,Opus 5 的代码评审意见多为琐碎 nit。
- 解码不慢、prefill 才痛:10–15 tok/s 解码体感尚可,但 31k token 冷启动 prefill 需 3 分钟,128k 全窗口近 18 分钟;暖启动后续轮次约 45 秒。
- MTP 是最大提速项:空窗口下从 7.3 提到 22.4 tok/s,但窗口填满后收益递减(256k 满窗仅 1.15 倍)。
- Flash Next 快在「想得少」而非每 token 快:同样 5/5 完成任务,token 少 45%,耗时 76.5s vs 27b 的 289.8s。思考 token 占这类模型输出的 90–95%,这个比例而非 tok/s 决定任务实际时长。
月成本 $0、完全离线。完整基准、配置与调优细节见其博客 deepu.tech。
「编程与Agent」频道最新
- Showly 让编码 agent 的输出一键变成可分享的网页 — hey_abusiddik · 2026-09-11
- Claude Code 五个维护命令:查技能、算成本、清上下文债务 — addyosmani · 2026-09-11
- OpenTrustBench:全本地 MCP 服务器安全扫描器开源发布 — BrilliantSecret143 · 2026-09-11
- 对抗 AI 代码 slop:先让 AI 考虑包内聚再生成目录结构 — newlido · 2026-09-11
- Codex 经 MCP 驱动达芬奇剪片:素材、字幕、混音全自动 — yungcontent · 2026-09-11
- Xcode 27 内置 MCP 服务器一条命令启动,交给 Claude 自动调试 — rudrank · 2026-09-11