llama.cpp PR 将 Qwen Flash 索引器显存占用减半
jacek2023 · reddit · 2026-10-03
llama.cpp 仓库合并了一个针对 Qwen 的优化 PR(qwen4exp):通过将 indexer score 显存占用减半,让 Qwen Flash Next 运行时占用更少 VRAM。对在本地跑 Qwen 长上下文/注意力相关功能、显存紧张的用户是直接的体验提升,PR 已进入 ggml-org/llama.cpp 主线。
「Infra」频道最新
- 买家秀翻车:AliExpress 迷你主机 BIOS 里硬编码假 N150 型号 — Ok-Shower7286 · 2026-10-03
- Crusoe CEO 上 20VC:融资 64 亿美元谈数据中心、GPU 折旧与能源账 — 20VC · 2026-10-03
- 单卡 RTX 5070 12GB 跑 177B 模型,实测 11-15 tok/s — ayobluestarr · 2026-10-03
- Cloudflare Durable Objects 支持无客户端时继续长任务 — threepointone · 2026-10-03
- SemiAnalysis:英伟达定制 NVHBM 为 Feynman 腾出约 25% 算力面积 — zephyr_z9 · 2026-10-03
- gufo-Qwen3.6-35B 本地实测:Strix Halo 上 3095 tok/s 预填充 — nubela · 2026-10-03