DeepSeek-V4-Flash 被移植至 AMD Strix Halo 运行
Fit-Produce420 · reddit · 2026-07-31
有开发者尝试在 AMD 最新的 Strix Halo 硬件上运行量化后的 DeepSeek-V4-Flash-GGUF 模型。
据反馈,该模型在单张 Strix Halo 上可支持约 64K 的上下文长度,推理速度大约为 35 tokens/s。虽然绝对速度不算惊艳,但如果模型能力表现稳定,这种端侧部署方案已具备一定的日常可用性。
「Infra」频道最新
- AI扩张瓶颈非算力而是基建人才,巨头斥数亿培训电工 — mustafamhus · 2026-07-31
- 实测:大模型做大脑+本地小模型打工,这套架构的瓶颈在哪? — InterviewDesigner777 · 2026-07-31
- 算完账我醒了:花四千刀买本地算力跑大模型到底值不值? — stfuhelp · 2026-07-31
- 纳德拉晒超大规模算力投资回报率图表,平均达 29.7% — firstadopter · 2026-07-31
- 仅花360美元,AMD V620显卡成功跑通ComfyUI与本地大模型 — Brave_Load7620 · 2026-07-31
- 原粒半导体完成超7亿元A轮融资,加速端侧AI芯片量产 — 创业邦 · 2026-07-31