8GB 显存本地跑 200 tok/s:实测 6 款小模型选型指南

TheMoonMidas · x · 2026-09-06

开发者 @nettermina 展示了一套极限优化方案:无需上万美元的 GPU,一块 8GB 显存的旧显卡(测试用的是 3070 Ti 笔记本)在 Windows 上即可跑 200 tok/s、128k 上下文、支持文本/图像/音频的本地模型。

团队拉取了 5 月以来所有能塞进 8-12GB 显存的 instruct 模型,用统一 20 项任务(JSON 抽取、代码、表格、算术、长提示词中的事实埋点、工具调用、图片识别等)实测了 6 款:Gemma 4 E4B、Gemma 4 12B、Qwen3.5-9B、Qwen3.5-4B、Ornith-1.5-9B 和 Qwen3.8-9B 蒸馏版。

结论:Gemma 4 E4B 并非全能第一——Qwen3.5-9B 和 Ornith 在长上下文与照片细节阅读上更强,但 E4B 综合来看最适合老卡新手。作者附上了复现配方,欢迎本地 AI 社区在老旧笔记本上尝试。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →