Ling 3.0 Flash 实测:Strix Halo 推理速度超 Qwen,但工具调用失效

Badger-Purple · reddit · 2026-08-11

开发者在 AMD Strix Halo 平台上使用 vLLM (ROCm/HIP) 实测了 4-bit 量化压缩的 Ling 3.0 Flash 模型。结果显示,其推理速度甚至超过了高度优化的 Qwen-122b (rocmFP4)。然而,作者也指出该模型目前存在一个功能性缺陷:工具调用功能已损坏。帖子向社区询问是否有人遇到类似情况。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →