Pi 与 mini-swe-agent 九项全过,二次代码审查仍揪出三处缺陷
Mysterious-Desk-3492 · reddit · 2026-10-07
作者在 AI Studio 项目中系统测试了 10 款编码 harness:Pi、mini-swe-agent、Crush、OpenCode、Goose、Prime Agent、Oh My Pi、Qwen Code、Octomind 和 Aider,模型用 DeepSeek V4.1 Flash、Qwen3.8-27B、Laguna S 2.1(经 OpenRouter 接入)。
初筛后对 Pi、mini-swe-agent、Crush、OpenCode 做 36 种「模型×任务」组合的详细代码审查,其中两次尝试未产出补丁。三个 Golang 任务各有侧重:HTTP 查询参数严格校验、迁移 200 处日志调用且保持行为、跨 API/存储迁移/HTML 渲染加书签标签。
结果:Pi 和 mini-swe-agent 在全部 9 个组合上都通过了原始验收检查,但二次 agent 审查加隔离复现探针暴露了三个问题——静默丢弃畸形查询字段、书签任务从 store 暴露可变 tag slice、一处迁移拒绝合法的旧版存储。好消息是所有日志迁移在覆盖 100 个函数、9 个整数输入(含极值)的差分探针下行为保持一致。
作者结论:评测器和审查者本身都需要被测试,「绿色通过」只说明通过了已有检查,更广的正确性需要更多证据;实验未能分出 Pi 与 mini-swe-agent 的胜负,人工修正耗时也尚未测量。
「编程与Agent」频道最新
- Claude Max $250 GitHub 额度倒计时 2 天,附一键薅完的 prompt — doodlestein · 2026-10-07
- 用 Codex 搭出 3D 飞行仿真,带深度缓冲与信号搜寻玩法 — MikePFrank · 2026-10-07
- FIXME:手机上圈个 bug,编码 Agent 通过 MCP 拿到全部上下文 — ZotZot69 · 2026-10-07
- 一首打油诗吐槽 MCP 灵魂拷问:每次工具调用都要重新认证一遍 — tdhopper · 2026-10-07
- 单人开发者做出首个通关 Minecraft 的 AI,胜 97% 人类玩家 — julianweisser · 2026-10-07
- PlanetScale:Agent 流量一夜翻倍,数据库如何既快又不宕机 — AI Engineer · 2026-10-07