DeepSeek V4 Flash 本地实测:Epyc + 5090 跑出 24 tok/s
IntravenusDeMilo · reddit · 2026-08-24
作者搭建了一台相对“廉价”的本地推理机器(AMD Epyc 7663 + 256GB ECC DDR4 + RTX 5090 32GB),并分享了运行 DeepSeek V4 Flash (UD-Q8KXL 量化版) 的实测数据。
- 性能表现:在 100-128k 上下文任务中,生成速度达到 23.8-24.6 tokens/sec。
- 首字延迟:Prompt 处理 (PP) 从初始的 60ms 降至最后的 385ms(得益于缓存)。
- 对比:移除 DFlash 后速度提升,且比临时使用的 3090 更快。
作者对无需花费 1 万美元即可在自家地下室运行如此高质量的模型感到惊讶。
「具身」频道最新
- Linus 赞中国开创机器人游戏新范式:如同希腊奥运 — LinusEkenstam · 2026-08-25
- 波士顿动力机器人在可口可乐工厂负责巡检 — Olivier__OG · 2026-08-25
- 机器人将带来就业繁荣,而非淘汰人类 — adamraudonis · 2026-08-25
- 人形机器人攻克爬楼梯难题:协调性演示展现突破 — CurieuxExplorer · 2026-08-25
- 演示视频:机械臂轻松实现写代码与打人 — lxfater · 2026-08-25
- 人形机器人完成百米障碍赛,亮相 2026 机器人奥运会 — davidpattersonx · 2026-08-25