默认 Codex CLI 配 GPT-5.5 在 XBOW 跑到 92.3%
evilsocket · x · 2026-07-24
- 这条帖子配图对应一篇关于自主渗透测试的论文:在 104 任务的 XBOW 基准上评估编码代理。
- 作者用默认版 Codex CLI、OpenCode 和 Pi,在相同的 GPT-5 模型、预算、接口和评分规则下做 plain-agent baseline,尽量排除脚手架带来的偏差。
- 核心结论是:专门的安全 harness 可能显著抬高分数,很多“架构提升”未必真来自模型本身。
- 论文主张在比较 XBOW 这类基准时,先报告模型匹配的朴素基线,再讨论架构设计是否真的带来增益。
「编程与Agent」频道最新
- Kernel 接入 Stripe Link:浏览器 Agent 一行 API 即可安全付款 — jeff_weinstein · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11