单卡 3090 跑 Qwen 27B 达 95+ TPS、262K 上下文,LlamAmpere v0.4 发布
Brief-Tap-6616 · reddit · 2026-09-29
开发者 JakeATX 发布 Llama.cpp 的 Ampere 专用优化分支 LlamAmpere v0.4,在单张 RTX 3090 上以 4.6bpw 量化跑 Qwen3.8 27B 实测 95+ TPS 生成速度、支持 262K 上下文,比上版提速约 10%、上下文再增 10%+,最强竞品 vLLM 相差不足 10% 但上下文上限更低。
要点:
- EXL3 格式提速显著,达到所测 4-XS-M 量化速度的约 80%,KLD 略低但未达任务级统计显著
- 模型基于 Swift-qwen 蒸馏,token 效率远高于原版训练,性能损失约 1%
- 提速对 12/16/20 GB 显存的用户最有价值
- 测速条件为 temp=1,避免 temp=0 短生成的「虚荣速度」
- 帖内附完整构建与启动命令(git clone + cmake,含 KV cache 量化 TQ 的讨论)
项目与模型均已开源(GitHub/Hugging Face),作者征集各 30 系显卡的实测结果。
「Infra」频道最新
- Starship 一次发射为全球互联网带宽新增约 1% — juanbenet · 2026-09-29
- 分离式量化:Prefill 与 Decode 各用最优格式,1-bit 精度涨 32 分 — ISTA-DASLab · 2026-09-29
- GPU 租赁价格 API 上线:实时追踪 H100/B200 行情 — virattt · 2026-09-29
- 2030 年数据中心仅占全球用电 3%,低于空调的 10% — JarnoDuursma · 2026-09-29
- Dagger 创始人:2026 年大 CI 瓶颈是软件问题,堆机器救不了 — msharmas · 2026-09-29
- llama.cpp 硬分叉泛滥引开源社区质疑:为何不向上游提 PR? — wombweed · 2026-09-29