DeepSeek v4.1 Flash 本地实测:q2 量化 16 tok/s,工具调用选错率高
challis88ocarina · reddit · 2026-09-12
- 作者在 M3U 32/80c 设备上用 q2 量化跑 DeepSeek v4.1 Flash:prefill 约 300 tok/s、decode 起步 16 tok/s,11 万 token 后才降到 16 tok/s 以下——持久性远好于 llama.cpp 的大幅掉速,GPU 全程 95% 占用。
- 工具调用功能正常但选择欠佳:hermes 工作流中先在本地盘两次 find 找远程文件,再 ls /.ssh/ 并 grep 整台远程机器,即使路径已打印在上下文中;18k token 的 hermes prompt 也不足以约束它。
- 代码执行工具被无视(4.0 时也如此),效率不如 GLM 5.3 Flash(对比约 21-19 tok/s)。
- 权衡:大显存跑大模型等待更久,q4 提速有限,期待 M5U 硬件。
「Infra」频道最新
- 玻璃基板无加强筋翘曲改善超2倍,成AI封装新方向 — jwt0625 · 2026-09-12
- d-Matrix 携手 NVIDIA:Raptor XPU 接入 NVLink Fusion 机架级系统 — bookwormengr · 2026-09-12
- 300K 上下文也扛不住大代码库,本地长任务如何自动交接 — Developer-Y · 2026-09-12
- 经济学人:英伟达已成「AI 的中央银行」 — tolugenius · 2026-09-12
- 24GB M5 MacBook Air 离线跑 LLM,选哪个 MoE 够快够好 — itis_whatit-is · 2026-09-12
- 16GB 显存跑 Qwen3.8 27B:DFlash2 草稿模型实测 60 tok/s — pneuny · 2026-09-12