27B小模型跑赢云端前沿模型,300美元8GB显卡就能本地部署

alexcovo_eth · x · 2026-08-31

@analogalok 实测 Qwen 3.8 27B(dense 版):在 Artificial Analysis Agentic Index 上得分 51,排名超过 GPT 5.6 Terra 和 DeepSeek V4 Pro,而它可以在一台 300 美元、8GB 显存的游戏本(RTX 4060/3070/5050 等)上以 5+ tokens/s 的速度运行,还能用电池供电。

技术要点:使用 Unsloth 新的 IQ4XS 量化(磁盘占用 14.6GB,比 Q4KXL 小 2GB),配合 CPU/GPU 混合卸载和 64,000 token 上下文窗口,16GB 内存的 i7-12700H + 8GB 显卡配置也不会 OOM。IQ4XS 相比 FP16 有轻微量化损失,但性能/显存比依然惊人。

作者给出了可直接复制的 llama.cpp 启动命令(含 -ctk q40 -ctv q40 K/V 缓存量化等关键参数),并预测 6 个月内 Opus 5 级别的 agent 智能可能完全离线跑在 8GB GPU 上。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →