27B 模型 Q5 量化+131k 上下文塞进单张 24GB 3090,提速 13-17%

bjivanovich · reddit · 2026-10-01

Reddit 用户发布 ATX-Swift-1.5-Qwen3.8-27B-Uncensored-MTP 量化套件(GGUF,i1-Q5KM 为主),在单张 RTX 3090 上实现完整 131072 tokens 上下文、50-65+ t/s 生成速度。

核心问题

方案

实测(80k-98k 深上下文,对比社区标准 Q5 量化)

附 HF 模型卡,提供 i1-Q80/Q6K/Q5KM/Q4KM 及多模态 mmproj-BF16 量化。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →