Benzi 编码 Agent 反其道行之:少读源码,SWE-bench 达 78.2%
DonkeyTheKing · reddit · 2026-08-28
- 现有编码 agent 靠拉取代码片段或做嵌入检索,token 暴涨、上下文漂移,compaction 后记忆丢失。
- Benzi 的思路是尽量不读源码:通过编译器/工具调用给模型提供确定性信息(如"哪些函数喂给这个函数"),编辑前后自动告知影响半径并跑静态分析。
- 用三级可信度保证不出错:RESOLVED(有确证)、CANDIDATE(静态分析未定)、OBSERVED(执行中实测)。
- 实测完成任务只需读 9,125 行源码,远少于 Claude Code(20,704)、DeepSeek harness(43,598)和 OpenCode(65K+,因反复失败被淘汰)。
- SWE-bench Verified 78.2%,单次修复成本低于 10 美分;支持 Python/JS/TS/Java/C#/C++/C/Go/Rust/Ruby,还带运行时追踪、任务中途自动升级模型等特性。
所属事件:Benzi编码Agent反套路:少读源码SWE-bench达78.2%(2 条相关)→
「编程与Agent」频道最新
- Agent 自动手写中文 NPU 内核,榨干低端算力性能 — yacineMTB · 2026-08-28
- AI Agent 在公司里失败的主因:先简化工作流再上智能体 — serpratik · 2026-08-28
- AI 开发者称 Agent 记忆应依赖 Schema 而非语义检索 — arpit_bhayani · 2026-08-28
- Claude 调用 Gamma 生成幻灯片:反 AI 味的配置实战 — cloudybrain07 · 2026-08-28
- Kimi Code 0.39.0 推出实验性远程控制,可远程接管本地 web 会话 — KimiDevs · 2026-08-28
- 分析证实 ExploitGym 评分器会拒绝投毒 Agent — moyix · 2026-08-28