默认 Codex CLI 跑出 XBOW 92.3%,引发基准失真讨论
moyix · x · 2026-07-24
这条帖子的核心不是“又一个高分”,而是 benchmark 已经失效。
- 讨论者称,他们只是用默认的 Codex CLI + GPT-5.5,没有自定义 harness,也没有额外脚手架,就在 XBOW benchmark 上拿到了 92.3%。
- 因此他们认为,继续拿 XBOW 分数做宣传已经没有意义,因为这个基准已经跟不上模型和工具链的进展。
- 转发里也补了一句:他们一年多前发布的 benchmark 现在已经过时,不应再用来衡量性能。
这是一个很典型的 agent / eval 失真 讨论素材。
「编程与Agent」频道最新
- Graph Engineering 让 Claude Code 走向可扩展工作流 — blaizedsouza · 2026-07-24
- 演讲嘉宾称 2026 是智能体之年,AGNTCON 与 MCPCon 将在阿姆斯特丹举行 — marlene_zw · 2026-07-24
- Anthropic 风格笔记提出多智能体知识图谱记忆层 — blaizedsouza · 2026-07-24
- AI Agent 不是只靠 Prompt:还要五层工程 — blaizedsouza · 2026-07-24
- 开发者重构 Claude Code 工厂:规划、实现、审查三段式 — blaizedsouza · 2026-07-24
- OpenCode TUI 因空内容字段触发崩溃 — juanmanuelramallo · 2026-07-24