MacBook 本地跑 Qwen 编码 Agent:上下文与输出双重瓶颈实战解析
Techngro · reddit · 2026-08-08
作者分享了在 MacBook Air(32GB)上使用 oMLX 运行 Qwen3.6-35B-A3B-4bit 模型,配合 Pi 编码 Agent 处理大型 TypeScript 仓库时遇到的严重瓶颈。
核心问题:
- 上下文空间不足:系统、工具和仓库指令的开销占据了约 10.2K Token,导致在 19.5K 的上下文窗口限制下,实际可用工作空间仅剩约 5K,频繁触发自动压缩(compaction)并中断任务。
- 输出长度受限:4K 的最大输出 Token 限制对于开启了思考模式(thinking)的 Qwen 模型来说过于局促,导致任务未完成就被截断。
优化思路:
- 削减系统指令开销,降低压缩后保留的 Token 数量(如将 keepRecentTokens 从 4096 降至 1024-2048);
- 在工具调用密集的代码审查阶段,考虑关闭或减弱模型的思考模式以节省输出预算;
- 针对不同任务(调查工具 vs 深度编码)使用不同配置;
- 探索在 32GB 苹果芯片上稳定扩展有效上下文窗口的可行方案。
「编程与Agent」频道最新
- Claude Code 支持会话间互发消息,推进多智能体协同 — Miles_Brundage · 2026-08-08
- 拆解热门概念 RLM:如何用 deepagents 构建递归智能体 — LangChain · 2026-08-08
- Claude Code 新功能:支持不同会话间互相通信 — EricBuess · 2026-08-08
- 吴恩达预言成真:Claude Code 多智能体编排实战工作流 — PrajwalTomar_ · 2026-08-08
- 智能体设计探讨:执行与验证为何必须分离 — OGMYT · 2026-08-08
- LangChain创始人关注:什么是RLM harness? — hwchase17 · 2026-08-08