8GB 显存本地跑 200 tok/s:实测 6 款小模型选型指南
TheMoonMidas · x · 2026-09-06
开发者 @nettermina 展示了一套极限优化方案:无需上万美元的 GPU,一块 8GB 显存的旧显卡(测试用的是 3070 Ti 笔记本)在 Windows 上即可跑 200 tok/s、128k 上下文、支持文本/图像/音频的本地模型。
团队拉取了 5 月以来所有能塞进 8-12GB 显存的 instruct 模型,用统一 20 项任务(JSON 抽取、代码、表格、算术、长提示词中的事实埋点、工具调用、图片识别等)实测了 6 款:Gemma 4 E4B、Gemma 4 12B、Qwen3.5-9B、Qwen3.5-4B、Ornith-1.5-9B 和 Qwen3.8-9B 蒸馏版。
结论:Gemma 4 E4B 并非全能第一——Qwen3.5-9B 和 Ornith 在长上下文与照片细节阅读上更强,但 E4B 综合来看最适合老卡新手。作者附上了复现配方,欢迎本地 AI 社区在老旧笔记本上尝试。
「Infra」频道最新
- T-Glass短缺加剧,Kinsus高端ABF月营收损失10-15% — zephyr_z9 · 2026-09-06
- 无凸点混合键合走向实用:Intel Diamond Rapids 率先落地,AMD Zen 传闻跟进 — bookwormengr · 2026-09-06
- Reddit 网友晒本地跑 AI 的硬件配置:大内存主机+轻终端远程访问 — Fun_Kangaroo512 · 2026-09-06
- 算力够吗?Reddit 热议自动化全部脑力劳动的能源门槛 — Vivid-Flamingo-644 · 2026-09-06
- 算力够吗?Reddit 热议自动化全部脑力劳动的能源门槛 — Vivid-Flamingo-644 · 2026-09-06
- llama.cpp 分块 KV cache 流式传输 PR:长上下文显存封顶 — giveen · 2026-09-06