默认 Codex CLI 配 GPT-5.5 在 XBOW 跑到 92.3%
evilsocket · x · 2026-07-24
- 这条帖子配图对应一篇关于自主渗透测试的论文:在 104 任务的 XBOW 基准上评估编码代理。
- 作者用默认版 Codex CLI、OpenCode 和 Pi,在相同的 GPT-5 模型、预算、接口和评分规则下做 plain-agent baseline,尽量排除脚手架带来的偏差。
- 核心结论是:专门的安全 harness 可能显著抬高分数,很多“架构提升”未必真来自模型本身。
- 论文主张在比较 XBOW 这类基准时,先报告模型匹配的朴素基线,再讨论架构设计是否真的带来增益。
「编程与Agent」频道最新
- Claude Code 和 Codex 怎么选,关键其实是外壳 — al_kRicha · 2026-07-24
- 生产环境里,各类 Agent 到底该用什么模型 — Logical-Silver-272 · 2026-07-24
- Offloop 4 人多智能体 harness 在 GDPval 上反超 Claude Code 和 Codex — rohanpaul_ai · 2026-07-24
- 图工程一句话总结:确定性多智能体循环就是 DAG — vincent_koc · 2026-07-24
- BackSearch 由 @ranko3000 主导开发,获得多位协作者反馈 — rosstaylor90 · 2026-07-24
- BackSearch 让智能体按历史日期搜索网页,避免未来信息泄漏 — brianrkelly · 2026-07-24