2x 4060 8GB 跑 Gemma 26B:mradermacher 量化实现 75 tok/s
Spiritual_Impress_30 · reddit · 2026-09-30
用户感谢量化作者 mradermacher:用其高质量量化在 2x RTX 4060 8GB 上通过 LM Studio 服务,让 gemma 4 26b 达到 75 tok/s 文本生成和 1500 pp 预填充,认为其量化质量是业内最佳。
「Infra」频道最新
- AI 芯片热潮推高韩国税收,预计创历史新高 — Polymarket · 2026-09-30
- 政府气象模型 WRF 移植 GPU,速度快一个量级出 250 米分辨率 — Scobleizer · 2026-09-30
- Ubuntu Snapdragon 版 ISO 已开放下载,高通 X2 笔记本可提前体验 — carrycooldude · 2026-09-30
- Canonical 与高通宣布:Ubuntu 将于 2027 年正式支持骁龙 X2 平台,面向本地 Agentic AI — carrycooldude · 2026-09-30
- GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈 — burkov · 2026-09-30
- 两年前还在写讣告的 Intel 迎来逆转,传其工艺良率已达 80% — 2C_ornot2C · 2026-09-30