Benzi 代理少读 55% 代码,SWE-bench 达 78.2% 单次修复不到 1 毛
DonkeyTheKing · reddit · 2026-09-16
开发者发布开源 coding harness Benzi,主张与其把大量源码塞进上下文,不如用确定性工具调用替代阅读代码:
- 核心思路:现有 agent(harness)靠检索代码片段或高维嵌入喂给模型,导致 token 暴涨、上下文漂移、多文件重构时行号错位需重新 grep。Benzi 从底层设计上让模型尽量不读源码,而是通过工具调用获得确定性信息——比如改代码前查询"哪些函数调用它",编译器直接告知改动影响范围(blast radius)并附带静态分析检查。
- 基准数据:Benzi Sonnet 完成同样任务只读 9,125 行代码,对比 Claude Code 20,704 行、DeepSeek harness 43,598 行、OpenCode 65K+(因反复失败被取消资格);SWE-bench Verified 达 78.2%,单次修复成本不到 10 美分(使用 V4flash)。
- 其他特性:明确区分可静态分析内容与需运行时验证的"truth tiers",并在其上叠加运行时 tracer;支持任务中途感知能力不足自动升级模型;支持 Python、JavaScript、TypeScript、Java、C#、C++、C、Go、Rust、Ruby 等 10 种语言。
- 作者观点:当全行业砸钱扩上下文窗口时,"索引仓库 > 读原始代码"的路线可能在经济性和代码理解能力上更划算。项目开源,GitHub 与在线 demo 均已放出。
「编程与Agent」频道最新
- happyrobot 播客拆解 FDE 模式:60 人规模为何会崩溃 — ivory_tang · 2026-09-17
- Hashiorp 创始人提「白板防御」:AI 时代能否讲清自己交付的系统 — charles_irl · 2026-09-16
- 让剪辑师边剪边口述理由,为 AI 剪辑智能体囤训练语料 — alexgoughcooper · 2026-09-16
- AI 让后端变全栈,前端专家与共享组件层谁来守护? — Most-Screen7458 · 2026-09-16
- ARIA 启动 Scaling Trust Arena,5000 万英镑建多智能体对抗测试场 — DavideCrapis · 2026-09-16
- 编码工具频繁作废 10 万 token 上下文缓存,用户苦寻不毁缓存的 harness — Academic-Tea6729 · 2026-09-16