两步优化让 Ling-3.0-flash INT4 推理速度提升 85%

AcanthisittaOk1699 · reddit · 2026-08-10

开发者 sudoingX 在单台 DGX Spark 上成功运行了 Ling-3.0-flash 的官方 INT4 量化版本,并通过两项关键调整将推理速度从 20.8 tok/s 提升至 38.7 tok/s。

优化配置如下:

重要避坑提示:原版 vLLM 目前不支持该模型架构,会静默走错注意力路径并输出看似流畅实则错误的内容。必须使用专用的 fork 版本(inclusionAI/vllm-ling-v3)才能正确运行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →