4GB 笔记本显存能跑本地 Qwen agent,但 RAG 会逼你频繁换模型
maikerukonare · reddit · 2026-07-26
作者在一台 RTX 3050 Ti 笔记本(4GB 显存) 上测试了一个本地 AI agent 工作台,模型通过 Ollama 自托管、完全不依赖云端 key。
他重点测了不同 Qwen 模型的速度和显存占用:
- qwen3.5:0.8b:122 tok/s,约 1.4GB,完全跑在 GPU 上
- qwen3.5:2b-q4KM:96 tok/s,约 2.4GB,依然能全 GPU 运行
- qwen3.5:4b:25 tok/s,约 3.4GB,已经有约三分之一溢出到 CPU
- qwen3.5:9b:8.6 tok/s,基本在 CPU 上跑,需要约 8GB
结论很直接:2B 是这台机器的甜点位。它既能保留大约 1.3GB 显存余量,又能在聊天、工具调用、视觉任务上保持不错速度。
帖子还把本地 RAG 的实际权衡讲得很细:
- embedding 模型和聊天模型没法同时常驻显存,所以 Ollama 会在两者之间切换
- 文档摄取在后台 worker 里做,避免堵住对话主路径
- 每次查询大致都会经历一次“嵌入查询 → 加载聊天模型 → 回答 → 再切回去”的切换成本
- 如果不想付这个 reload 代价,可以换更小的 embedder,或者把 embeddings 放到 CPU
此外,他也指出小模型在一些任务上仍然吃力:
- 生成 artifact 时,普通 qwen3.5 往往会写出半成品 HTML,需要切换到 coder 向模型
- 工具一多,模型的 tool selection 也会开始变差
整体来说,这是一个非常具体的 4GB 本地 agent 工作台实测复盘,把“能跑”和“真能用”之间的差距讲清楚了。
「编程与Agent」频道最新
- Kernel 接入 Stripe Link:浏览器 Agent 一行 API 即可安全付款 — jeff_weinstein · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11