让 Claude 与 Codex 各写国际象棋引擎对战:Claude 10:0 碾压
Twaain · reddit · 2026-08-01
一位开发者进行了一项硬核测试:分别给 Claude(Fable 5 模式)和 OpenAI Codex 下达同一个提示词,要求它们用 C++ 从零编写一个完整的国际象棋引擎,并让两者进行 10 局对弈。
测试结果:
- Claude 10:0 完胜:所有对局均以将死结束,没有平局。
- Codex 表现出高度确定性:在执白的 5 局比赛中,它走出了完全相同的 24 步棋,甚至包括第 24 步被吃后将死的结局。
- 工程细节差异:Claude 在开发过程中主动进行了规则验证(perft 测试)并修复了 3 个潜在 Bug,而 Codex 缺乏此类自我校验。
作者也坦诚了实验的局限性,例如这仅测试了单次生成的引擎质量,而非模型本身的通用编码能力。
所属事件:AI 编写国际象棋引擎对战 Claude 完胜 OpenAI(2 条相关)→
「编程与Agent」频道最新
- 基于真实数据与 PR 记录,构建代码智能体专属评测基准 — Hacubu · 2026-08-01
- Y Combinator 开源内部多智能体框架 QM — ycombinator · 2026-08-01
- 开发者观点:只要需求清晰,AI 现在就能一键生成整套代码 — shauseth · 2026-08-01
- 开发者打造Aura本地Agent:将大模型降级为纯语音输出组件 — bryany97 · 2026-08-01
- Reddit热议:开发AI Agent时哪些坑是真正跑起来才遇到的? — Meher_Nolan · 2026-08-01
- 用 Obsidian 打造 AI 素材库:提升提示词效果与工作流 — EXM7777 · 2026-08-01