8GB 显存跑 35B 模型 131K 上下文,作者公开完整参数
Aggravating-Push-207 · reddit · 2026-09-24
作者分享在 8GB VRAM 的 4060 笔记本 + 16GB 内存上以 131K 上下文运行 Cyber-Tiel-Coder-35B-A3B(UD-IQ3XXS 量化)的完整 llama.cpp 参数:MOE 层部分卸载 CPU、KV cache 量化 q40、draft-MTP 投机解码等,稳定达到约 35 tok/s prefill、23 tok/s decode(4K 上下文)。配置由 OpenCode 调用某 stealth 模型通宵扫描优化得出,作者承诺随后附 13 条 prompt 的基准测试表。
「Infra」频道最新
- MongoDB 3.0 大转型:十年销售驱动模式正被推倒重来 — thedealdirector · 2026-09-24
- rauchg 拆解成功 Agent 三要素:大脑、双手与文件,云端需解耦 — cramforce · 2026-09-24
- Meta 承诺 120 亿美元算力,Nebius 合同隐藏 150 亿上行空间 — AccBalanced · 2026-09-24
- AMD APU 模型加载获修复,Lemonade 弃用比 Vulkan 慢约 40 倍的 ROCm 后端 — Fcking_Chuck · 2026-09-24
- NVFP4 真能媲美 Q8?5090 用户质疑量化「无脑选」建议 — nirurin · 2026-09-24
- NVIDIA 实测 Cosmos 3 Super 视频生成服务:延迟与吞吐如何权衡 — NVIDIA Developer · 2026-09-24