编译器驱动的 Benzi 声称胜过 Claude Code:SWE-bench 78.2%、每修复不到 1 毛钱
DonkeyTheKing · reddit · 2026-10-02
开发者发布 Benzi——一个以编译器/静态分析为核心、而非靠读源码的 AI 编码 agent,并附 benchmark 与 demo。
核心思路:现有 agent(Claude Code、OpenCode 等)靠拉取代码片段或高维 embedding 逼近程序结构,导致 token 暴涨、上下文漂移、compaction 后遗忘、多文件重构时行号失效。Benzi 反其道:不读源码,通过工具调用给模型确定性信息——改动前编译器直接告知影响范围(blast radius)并做完整静态检查,模型只在需要时查询「哪些函数调用了这个」。
数据:Benzi Sonnet 完成同样任务只读 9,125 行代码,对比 Claude Code Sonnet 20,704 行、DeepSeek harness 43,598 行、OpenCode 65K+(因反复失败被取消资格)。
其他特性:区分「静态可分析/不可分析」的 truth tiers,辅以运行时 tracer 补缝;语法与语义校验的写入、上下文感知的模型自写复现、任务过难时中途升级模型。支持 Python、JS/TS、Java、C#、C++、C、Go、Rust、Ruby 等。
成绩:SWE-bench Verified 78.2%,用 V4flash 时单次修复成本不到 10 美分。作者主张:与其烧钱扩上下文,不如索引仓库胜过读原始代码。
「编程与Agent」频道最新
- Decagon 发布 Personal Agent Gateway,让企业优雅接待 AI 代理 — kimberlywtan · 2026-10-02
- AI 编码 agent 需护栏:单元测试防跑偏,但小心测试膨胀 — randal_olson · 2026-10-02
- AI 编码 agent 为何要配 TDD?护栏与回归测试才是关键 — randal_olson · 2026-10-02
- Sentry 创始人:Agent 需要贴合团队流程的确定性工作流 — zeeg · 2026-10-02
- 经济学家实测:AI 研究智能体 45 分钟跑完全套分析,总成本仅 $19 — soumitrashukla9 · 2026-10-02
- Sentry 开源 coding agent Junior 推进 plan-first 编码模式 — zeeg · 2026-10-02