编译器驱动的 Benzi 声称胜过 Claude Code:SWE-bench 78.2%、每修复不到 1 毛钱

DonkeyTheKing · reddit · 2026-10-02

开发者发布 Benzi——一个以编译器/静态分析为核心、而非靠读源码的 AI 编码 agent,并附 benchmark 与 demo。

核心思路:现有 agent(Claude Code、OpenCode 等)靠拉取代码片段或高维 embedding 逼近程序结构,导致 token 暴涨、上下文漂移、compaction 后遗忘、多文件重构时行号失效。Benzi 反其道:不读源码,通过工具调用给模型确定性信息——改动前编译器直接告知影响范围(blast radius)并做完整静态检查,模型只在需要时查询「哪些函数调用了这个」。

数据:Benzi Sonnet 完成同样任务只读 9,125 行代码,对比 Claude Code Sonnet 20,704 行、DeepSeek harness 43,598 行、OpenCode 65K+(因反复失败被取消资格)。

其他特性:区分「静态可分析/不可分析」的 truth tiers,辅以运行时 tracer 补缝;语法与语义校验的写入、上下文感知的模型自写复现、任务过难时中途升级模型。支持 Python、JS/TS、Java、C#、C++、C、Go、Rust、Ruby 等。

成绩:SWE-bench Verified 78.2%,用 V4flash 时单次修复成本不到 10 美分。作者主张:与其烧钱扩上下文,不如索引仓库胜过读原始代码。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →