Pi 与 mini-swe-agent 九项全过,二次代码审查仍揪出三处缺陷

Mysterious-Desk-3492 · reddit · 2026-10-07

作者在 AI Studio 项目中系统测试了 10 款编码 harness:Pi、mini-swe-agent、Crush、OpenCode、Goose、Prime Agent、Oh My Pi、Qwen Code、Octomind 和 Aider,模型用 DeepSeek V4.1 Flash、Qwen3.8-27B、Laguna S 2.1(经 OpenRouter 接入)。

初筛后对 Pi、mini-swe-agent、Crush、OpenCode 做 36 种「模型×任务」组合的详细代码审查,其中两次尝试未产出补丁。三个 Golang 任务各有侧重:HTTP 查询参数严格校验、迁移 200 处日志调用且保持行为、跨 API/存储迁移/HTML 渲染加书签标签。

结果:Pi 和 mini-swe-agent 在全部 9 个组合上都通过了原始验收检查,但二次 agent 审查加隔离复现探针暴露了三个问题——静默丢弃畸形查询字段、书签任务从 store 暴露可变 tag slice、一处迁移拒绝合法的旧版存储。好消息是所有日志迁移在覆盖 100 个函数、9 个整数输入(含极值)的差分探针下行为保持一致。

作者结论:评测器和审查者本身都需要被测试,「绿色通过」只说明通过了已有检查,更广的正确性需要更多证据;实验未能分出 Pi 与 mini-swe-agent 的胜负,人工修正耗时也尚未测量。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →