单张 RTX 5090 跑 27B 模型 256k 上下文,110+ tokens/s
Ok-Shower7286 · reddit · 2026-10-07
开发者在 r/LocalLLaMA 分享其 llama.cpp fork「focus-llama」:单张 RTX 5090 上以 Q6KXL 高精度量化跑 Qwen3.8-27B,实现 256k 逻辑上下文、110+ t/s 稳定生成速度。
核心思路
- 原版 llama.cpp 按 -c N 一次性分配全部物理 KV buffer,VRAM 随上下文线性增长,解码速度随上下文变长从约 120 t/s 掉到 60 t/s
- focus-llama 把物理 KV buffer 封顶在约 85k cells(--kv-cache-size),逻辑上下文保持 256k,旧 chunk 卸载到外部存储(focus-memory)按需取回
- 由于驻留 KV cell 数被 buffer 上限约束,每步注意力成本由 buffer 大小而非逻辑上下文长度决定,速度稳定在 118–135 t/s
- 基于并实现了 Google DeepMind 提出的 declarative attention 与 skill.state 两项技术,另配 adaptive MTP 投机解码
- 实际效果:上下文占用稳定在 18–30%,跑 Cline/Qwen Code 等编码 agent 不会再触发整日的 compaction 暂停
作者贴出完整配置命令与日志,适合想在单卡上跑长上下文编码工作流的本地部署用户参考。
「编程与Agent」频道最新
- OpenAI Decisions API 支持图像输入,13 美分挑出 40 分钟素材最佳表情 — stevenheidel · 2026-10-07
- Brain Co 推出面向 AI Agent 的设计系统 Synapse,把设计判断写进组件 — LVidegaray · 2026-10-07
- 开发者称旧 vibe coding 工作流反成劣势:直接说需求即可 — TheMoonMidas · 2026-10-07
- 开发者更新 Lerna 插件:Copilot CLI 可动态路由至微软 Foundry — unixterminal · 2026-10-07
- 观点:智能体正处「捆绑期」,下一波将是窄场景专用 Agent — signulll · 2026-10-07
- Google 与 MIT 发布 Coco:用智能体辅助 TPU 硬件-模型协同设计 — dair_ai · 2026-10-07