LlamAmpere 新版:12GB 显存跑 27B 模型,200K 上下文加 MTP 提速
Brief-Tap-6616 · reddit · 2026-10-10
开源推理项目 LlamAmpere 发布针对消费级显卡的新版本,重点优化 12GB Ampere 卡(3060/3080 级),同时为 3090 用户带来 3-4% 提速与更小的运行时占用(YaRN 下可支持约 340K 上下文)。
- 新增 Staged + Journaled KVaRN 变体,KLD 较论文忠实实现与竞品版本降低约 40%。
- 4/4 配置成为大显存卡的新默认推荐;追求极限上下文可用 3/3(KLD 0.001)或 3/2 位(0.0024),分别支持约 205K-230K 上下文,占用约 11GB。
- 测试模型为 swift-1.5-uncensored 与 mirai 2.5bpw 模型的 2.3bpw 融合版,LiveCode Bench 七轮测试保留 BF16 性能的 85%,3080/ti 上借助 MTP 达约 65-70 tps。
- 作者实测可用于常规 agentic 任务,主观评价介于 Qwen3.5 与 3.6 的 BF16 版本之间;项目 MIT 协议开源,模型合集已上 Hugging Face。
「Infra」频道最新
- 多智能体系统 105 小时自动调优,Qwen3.5 推理提速 175 倍超 SGLang — bariskasikci · 2026-10-10
- 硬件×模型组合爆炸,定制化推理服务系统成唯一可行路径 — bariskasikci · 2026-10-10
- 「AI 泡沫」餐巾纸算术:模型降本 100 倍,还需 1000 倍 GPU — gabriel1 · 2026-10-10
- Super Micro 承包商认罪:涉案 25 亿美元走私英伟达 AI 芯片入华 — Polymarket · 2026-10-10
- Cloudflare 收购 Deno,但 Deno 运行时仅再维护一年 — Simon Willison · 2026-10-10
- 从买服务器到 Rust 重写:应用扩展方式的三代变迁 — tristanbob · 2026-10-10