R9700+Strix Halo 实测:ROCm 仍领先 DeepSeek,Vulkan 追近差距
Hrethric · reddit · 2026-09-22
Reddit 用户 ainsoph00 在 R9700 + Strix Halo 上用 llama.cpp(0.4.1-dev)对比 ROCm 10.0 与 Vulkan(Mesa 26.2.3 RADV)跑 DSv4 Flash 0731 和 Qwen 3.8 Flash Next 的性能。相比几周前的测试,环境已大幅更新:Linux 内核与固件升级、ROCm 7.14→10、Mesa 升级、llama.cpp 大量性能优化。
结论:
- DSv4 Flash 0731(UD-IQ4NL + DSpark 投机草稿模型):ROCm 仍是最佳选择,但 Vulkan 已明显追近差距;needle 长文测试中 ROCm 达 154.7 tok/s prompt 处理、24.1 tok/s 生成
- Qwen 3.8 Flash Next(UD-Q4K-XL,无投机解码):格局更模糊——prompt 处理 ROCm 占优(566 tok/s),token 生成 Vulkan 占优
测试用两个 prompt:3.4 万词的四针needle测试,以及经典的 Coleridge v Tennyson 对比题。后者输出再交 Claude Opus 5 评判:Qwen(Model B)论点扎实、证据具体、洞见更好,但有数处自信的事实错误;DeepSeek(Model A)更安全但平庸,错误属解读性而非事实性——对懂行的读者 B 明显更强,对全盘照单的读者 A 更不易误导。
「Infra」频道最新
- LLM推理提速实操:以31B模型为例讲透TPS优化 — abhijithneil · 2026-09-22
- rakyll:全托管平台因丧失可组合性与可复现性而失败 — rakyll · 2026-09-22
- 本地 Qwen 27B Agent 接管亚马逊账号,一次跑通自动买纸 — fuzhongkai · 2026-09-22
- Qwen Code TUI 每次缩小行数吞掉一行记录,根因锁定 ink 7.0.3 — SnowCore8 · 2026-09-22
- CBS 60分钟:高尔夫球场用水是数据中心的2倍多 — SumitGup · 2026-09-22
- DeltaTensors 给微调模型做增量存储:953MB 压到 294MB — cupheadgamer · 2026-09-22