Ling 3.0 Flash 实测:Strix Halo 推理速度超 Qwen,但工具调用失效
Badger-Purple · reddit · 2026-08-11
开发者在 AMD Strix Halo 平台上使用 vLLM (ROCm/HIP) 实测了 4-bit 量化压缩的 Ling 3.0 Flash 模型。结果显示,其推理速度甚至超过了高度优化的 Qwen-122b (rocmFP4)。然而,作者也指出该模型目前存在一个功能性缺陷:工具调用功能已损坏。帖子向社区询问是否有人遇到类似情况。
「模型」频道最新
- Hugging Face模型更新:更好支持多角色 — OdinLovis · 2026-08-11
- 探究 Claude 与 GPT 的知识截止日期及预训练时间线 — sshh12 · 2026-08-11
- Grok 4.6 现已在 Cursor 上线 — daniel_mac8 · 2026-08-11
- 文件名带"final_draft"竟拉高评分?LLM审稿被指严重受无关文字干扰 — CShorten30 · 2026-08-11
- 用户实测 Grok 新版:Minecraft 建房测试中代码偷懒问题已修复 — Angaisb_ · 2026-08-11
- 实测 Cursor 中的 Grok:速度与执行力出众,但欠缺创造力 — andrew_n_carr · 2026-08-11