让本地 27B 通宵长程编程一天:开发者复盘可行与踩坑
paulqq · reddit · 2026-09-26
一位开发者让本地部署的 Qwen 27B(llama.cpp,RTX 4080 SUPER + RTX A4000 双卡张量切分)在 deepseek harness 里通宵长程编码,约一天内建出两个本地 agent 工具(一个监控 LLM endpoint,一个画 GPU 图表),并总结了经验。
有效的做法
- 记忆用文件而非上下文:每步重写状态文件作为恢复接口,agent 冷启动也能接续;上下文中途被压缩也不影响工作。
- 小切片+验证:按阶段拆分,先跑机器检查(测试、typecheck、curl),人眼复核在后,永远不超过上次验证一个切片。
- 给测试用一次性端口:人的主 UI 和 LLM 服务器绝不触碰。
- 真正的 UI bug 靠人看截图发现,模型自己「看不到」。
踩过的坑
- 没有浏览器,「视觉验证」只能 grep 压缩后的 JS bundle。
- 与被监控的推理服务共享槽位,一次粗心的 POST 会让自己排队挂死,只能用 fixtures。
- 同卡加载其他大模型可能引发 OOM,只做只读探测。
- 构建中途 Q6→Q4 量化切换会让笔记里的数字全部过期,需重新验证。
- 针对尚不存在的契约写测试只会堆红测试,应停下来写拆分方案。
- 旧宿主+新客户端=空白面板,需要 null 守卫和喂旧 JSON 形状的回归测试。
作者强调分工是「结对」:模型写大部分代码,人定规则、决定取舍和发布。
「编程与Agent」频道最新
- GitHub 弃用 CSS-in-JS 迁移至 CSS Modules,服务端渲染提速 55% — DanWahlin · 2026-09-26
- 开源 Grok 客户端 Lorca 发布:Mac 原生 App 加 iOS 配对,智能体跑在电脑上 — dotey · 2026-09-26
- 从库和脚手架到技能与 lint 规则:AI 时代的封装物在变 — fernandorojo · 2026-09-26
- ComfyUI 时间线插件实测:MiniMax H3 视频无缝续接生成 — smereces · 2026-09-26
- 让 Agent 操作已登录浏览器前,作者定下四道安全门槛 — Own-Equipment-5454 · 2026-09-26
- GCC 禁 AI 代码贡献,LLVM 允许但要求开发者必须理解代码 — lemire · 2026-09-26