为 RTX 3090 定制的 llama.cpp fork,27B 模型跑出 90+ TPS
Brief-Tap-6616 · reddit · 2026-09-15
Reddit 用户发布了一个专为 Ampere 架构(30 系显卡)优化的 llama.cpp fork——llamAmpere,Blackwell 和 Lovelace 架构也能受益。
- 推荐配置下,100K token 内可达 90+ TPS(适合 agent/编码场景),最长支持 240K 上下文
- 配套发布 Qwen3.8-27B 的 IQ4XS 量化 GGUF,质量约等于 4KM 但明显更快
- 作者称在 200K 上下文时比同类方案快约 80%,27B 模型在 3090 上的本地速度已超过 API
「Infra」频道最新
- 从照明成本降千倍看推理成本:Suhail 断言同样的暴跌正在发生 — npew · 2026-09-15
- HTTP 200 不是成功:AI 端点监控别放过空补全响应 — gethackteam · 2026-09-15
- 美国第二大律所 Latham 自建 AI 栈,被称大厂最怕的信号 — MikeBirdTech · 2026-09-15
- 买 Mac 跑本地模型多久回本?Sunk Cost 帮你算清这笔账 — rlindsey123 · 2026-09-15
- GLM 5.3 Flash EXL3 新增 TP=3 路径:三台 DGX Spark 解码提速 28% — HankYeomans · 2026-09-15
- Dario 降速论难挡算力扩张:硬件建设轨迹不会改变 — AccBalanced · 2026-09-15