4×AMD V620 跑 DeepSeek-V4-Flash:300K 上下文,生成 21 tok/s
Thin_Pollution8843 · reddit · 2026-08-15
用户用 4 块 AMD Radeon Pro V620(共 128GB VRAM)运行 DeepSeek-V4-Flash-0731 的 IQ3XXS 量化版,配合 DSpark 投机解码。32K prompt 摄入速度 276 tok/s,短 prompt 摄入 379 tok/s,连续生成 21 tok/s,接受生成 30.6 tok/s。但 q3xxs 量化导致模型“变傻”,且 VRAM 不足无法放置 drafter。
「Infra」频道最新
- 英伟达开源 NeMo Switchyard,支持智能体模型动态路由 — NVIDIAAI · 2026-08-15
- Vercel 被评为全球最快的 AI Gateway 基础设施 — cramforce · 2026-08-15
- Qwen3.8-2.4T-A95B部署指南:NVFP4需8×B300,TP必须整除64 — Necessary_Gazelle211 · 2026-08-15
- mcpp:自动从代码生成 MCP 服务器的 C++ 库 — karurochari · 2026-08-15
- RTX 3090 跑 Qwen 3.8 27B 约 35 t/s — cviperr33 · 2026-08-15
- CME 推出英伟达 H100 算力期货,视算力为 AI 时代货币 — AccBalanced · 2026-08-15