Qwen3.8 27B 量化版挤进 24GB 显存跑 10 万上下文,本地模型威胁前沿定价

ChopSticksPlease · reddit · 2026-09-05

发帖人感谢 Qwen 与 Unsloth 团队发布的 Qwen3.8 27B UD Q4KXL 量化版:在单张 3090 的 24GB 显存里即可实现 10 万 token 上下文(Q8 缓存),跑 agent 编码表现出色。

作者观点:真正威胁 Anthropic/OpenAI 利润的不是又一个前沿模型,而是这种能本地高速运行、承担 80-90% 日常编码工作且零 API 成本的小模型。

他同时提出目前市场存在空档:Kimi-K3 对多数企业和个人消费者遥不可及,于是在社区征询:双 GPU 服务器(96-192GB 显存 + 256GB 以上内存)或 2-4 台 DGX 集群,能否以 >30tps 的速度跑 MiniMax-M3 做 agent 编码?他自己的双 3090 + 128GB 机器跑 Qwen3.8-Flash-Next Q4 很快,但感觉并不比 27B 小模型聪明多少;能跑更大的量化模型(Minimax-M2.7 是主力)但对编码来说太慢。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →