单文件98GB跑DeepSeek V4 Flash:AMD端侧推理实测破32 tok/s
tensorqt · x · 2026-08-12
Lucebox 与 Geometric 合作,成功将 DeepSeek-V4-Flash-0731 部署在 128 GB 的 AMD Strix Halo 系统上。
- 端侧部署:模型被压缩为单个 98.29 GB 的 GGUF 文件,可直接在 Radeon 8060S iGPU 上完整加载,无需拆分或附加文件。
- 质量评测:在 92 题的综合评测中得分 82/92,其中 COMPSEC-17 拿到满分 17/17,质量基本无损。
- 推理速度:在默认的质量模式下解码速度为 18.1 tok/s;若开启更快的 DSpark 辅助模式,速度可达 22.3 至 32.7 tok/s,但会略微牺牲准确度。
所属事件:AMD Strix Halo实测跑DeepSeek:端侧推理破32 tok/s(2 条相关)→
「Infra」频道最新
- StarCloud 探索太空数据中心:将 AI 硬件送入轨道 — DavidLinthicum · 2026-08-12
- gakonst 为 nanocodex 添加机密计算支持,实现可验证的机密 AI — AccBalanced · 2026-08-12
- 阿里云 CUBE 5.0 模块化设计:100 天建成 AI 数据中心并降本 10% — rohanpaul_ai · 2026-08-12
- CoreWeave 获 26 亿美元信贷,押注英伟达 GPU 长期价值 — OnlineInference · 2026-08-12
- poolside 举办 Laguna 模型加速赛,社区将其推理速度提升 2.6 倍 — gajesh · 2026-08-12
- 沙箱成为新无服务器原语:AI Agent 改变了底层架构 — s4chinraja · 2026-08-12