4GB 笔记本显存能跑本地 Qwen agent,但 RAG 会逼你频繁换模型
maikerukonare · reddit · 2026-07-26
作者在一台 RTX 3050 Ti 笔记本(4GB 显存) 上测试了一个本地 AI agent 工作台,模型通过 Ollama 自托管、完全不依赖云端 key。
他重点测了不同 Qwen 模型的速度和显存占用:
- qwen3.5:0.8b:122 tok/s,约 1.4GB,完全跑在 GPU 上
- qwen3.5:2b-q4KM:96 tok/s,约 2.4GB,依然能全 GPU 运行
- qwen3.5:4b:25 tok/s,约 3.4GB,已经有约三分之一溢出到 CPU
- qwen3.5:9b:8.6 tok/s,基本在 CPU 上跑,需要约 8GB
结论很直接:2B 是这台机器的甜点位。它既能保留大约 1.3GB 显存余量,又能在聊天、工具调用、视觉任务上保持不错速度。
帖子还把本地 RAG 的实际权衡讲得很细:
- embedding 模型和聊天模型没法同时常驻显存,所以 Ollama 会在两者之间切换
- 文档摄取在后台 worker 里做,避免堵住对话主路径
- 每次查询大致都会经历一次“嵌入查询 → 加载聊天模型 → 回答 → 再切回去”的切换成本
- 如果不想付这个 reload 代价,可以换更小的 embedder,或者把 embeddings 放到 CPU
此外,他也指出小模型在一些任务上仍然吃力:
- 生成 artifact 时,普通 qwen3.5 往往会写出半成品 HTML,需要切换到 coder 向模型
- 工具一多,模型的 tool selection 也会开始变差
整体来说,这是一个非常具体的 4GB 本地 agent 工作台实测复盘,把“能跑”和“真能用”之间的差距讲清楚了。
「编程与Agent」频道最新
- Stable Diffusion Prompt Manager 新增交互式表情选择节点 — Francky_B · 2026-07-26
- 大多数 agent 团队该先优化 harness 再碰权重 — hwchase17 · 2026-07-26
- 模型迁移不该只测兼容性,还要证明行为一致 — hwchase17 · 2026-07-26
- 拥有 AI 也意味着要拥有它使用的数据 — hwchase17 · 2026-07-26
- Jeff Dean 在 YC 讲上下文工程:系统比模型更重要 — ycombinator · 2026-07-26
- 单卡56GB显存跑终端智能体测试,目前得分率达60% — victormustar · 2026-07-26