8GB 显存跑 35B 模型 131K 上下文,作者公开完整参数

Aggravating-Push-207 · reddit · 2026-09-24

作者分享在 8GB VRAM 的 4060 笔记本 + 16GB 内存上以 131K 上下文运行 Cyber-Tiel-Coder-35B-A3B(UD-IQ3XXS 量化)的完整 llama.cpp 参数:MOE 层部分卸载 CPU、KV cache 量化 q40、draft-MTP 投机解码等,稳定达到约 35 tok/s prefill、23 tok/s decode(4K 上下文)。配置由 OpenCode 调用某 stealth 模型通宵扫描优化得出,作者承诺随后附 13 条 prompt 的基准测试表。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →