Thoughtworks 工程师实测四周:本地模型写代码到底行不行
bibryam · x · 2026-10-04
Thoughtworks 杰出工程师 Birgitta Böckeler 发文评估在本地跑开源模型做编码(尤其是 agentic coding,而非自动补全)的可行性。
要点:
- 此前她多次尝试本地模型都以失望告终,但近期关于本地模型编码能力大幅进步的说法太多,于是重新投入约 4 周时间实测。
- 测试硬件为 Apple M3 Max(48GB 内存)和 Apple M5 Pro(64GB 内存)两台机器。
- 评估范围不只是模型能否跑起来,还包括对不愿折腾规格和工具链的普通开发者而言是否开箱可用。
- 影响可行性的因素繁多:资源约束下的配置选择、自动化评测结果中的噪声等,使得筛选网上各种成功案例的信号非常困难。
- 一个反直觉发现:在自动化评测设置中,某模型在更强机器上反而结果更差。
本文是该系列的第一篇,先讲影响因素的框架,后续备忘录将详述实际使用体验。
「编程与Agent」频道最新
- 开源编码模型距前沿多远?开发者猜测差距不足六个月 — heyneighbor · 2026-10-04
- 区分 Harness 与 Loop 工程:让 AI 智能体持续可靠工作的两套方法 — goyalshaliniuk · 2026-10-04
- ffmpeg-skill 让 AI 编程助手真正会剪视频,本地运行内置 42 个工具 — udmrzn · 2026-10-04
- 跑一次校准解码快 3 倍:16GB 显卡跑 256K 上下文的调优实录 — MoonsvnLyn · 2026-10-04
- 一句提示清掉 39.7GB:用 ccmd MCP 让 Claude Code 安全清缓存 — julsimon · 2026-10-04
- Agent Guard 用 CEL 策略拦截编码 agent 的危险依赖安装 — HowDevelop · 2026-10-04