300 页专著:评估与操作可靠编码 Agent 的系统工程
heyneighbor · x · 2026-08-18
Stephanie Jarmak 发布了长达 300 多页的 arXiv 专著《Engineering Reliable Coding Agents》,探讨如何评估和操作可靠的编码 Agent。
核心观点:
- 编码 Agent 通常作为模型被评估,但实际作为系统部署。其可靠性不仅取决于模型能力,更取决于约束、执行状态、检索、记忆管理、权限、审查界面和资源分配。
- 许多看似模型的失败实际上源于系统的其他部分。
内容贡献:
- 综合了 164 篇学术文献、100 份从业者记录等证据。
- 提出了一个版本化的目录,包含 206 条可靠性记录(193 条门控实践,13 条研究线索)。
- 提供了 Agent 生命周期中依赖和修复不对称性的框架。
随书发布了配套代码库和更简短的入门论文《Software Factories are Distributed Systems》。
「编程与Agent」频道最新
- Cognition 工程师全程用 Devin 云智能体,把官网从 Astro 迁到 Next.js — DevinAI · 2026-08-18
- Codex 提议通过未认证 API 关停服务器 — hugobowne · 2026-08-18
- 新框架让 DeepSeek 超越 Claude,成本仅 1/11 — Azaliamirh · 2026-08-18
- 小团队如何搭建多模型统一 AI 工作台? — Efficient-Wing2553 · 2026-08-18
- 如何解耦 Agent 框架与模型进行公平评测? — DynamicWebPaige · 2026-08-18
- 独立开发者用多 AI 模型组队自动化构建游戏 — econoar · 2026-08-18