DeepSeek-V4-Flash 被移植至 AMD Strix Halo 运行

Fit-Produce420 · reddit · 2026-07-31

有开发者尝试在 AMD 最新的 Strix Halo 硬件上运行量化后的 DeepSeek-V4-Flash-GGUF 模型。

据反馈,该模型在单张 Strix Halo 上可支持约 64K 的上下文长度,推理速度大约为 35 tokens/s。虽然绝对速度不算惊艳,但如果模型能力表现稳定,这种端侧部署方案已具备一定的日常可用性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →