llama.cpp PR 将 Qwen Flash 索引器显存占用减半

jacek2023 · reddit · 2026-10-03

llama.cpp 仓库合并了一个针对 Qwen 的优化 PR(qwen4exp):通过将 indexer score 显存占用减半,让 Qwen Flash Next 运行时占用更少 VRAM。对在本地跑 Qwen 长上下文/注意力相关功能、显存紧张的用户是直接的体验提升,PR 已进入 ggml-org/llama.cpp 主线。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →