Dev: Claude wins benchmarks but Codex better at doing what I want
Kuprel · x · 2026-10-07
Developer Kuprel notes that despite Claude outperforming on benchmarks, OpenAI's Codex "seems to be better at doing what I want done" — another data point that benchmark scores don't always track real-world usefulness.
More from coding & agent
- Figure CEO: filling Vietnam's brutal visa form was our AGI test — now an agent passed it — adcock_brett · 2026-10-07
- Vite+ 1.1 released: 24% faster vp dev startup, 30% less memory, clearer prompts — irvinebroque · 2026-10-07
- solid-yield Brings Generator-Based Type-Safe Components to Solid 2 as AI Sparks a Yield Renaissance — samgoodwin89 · 2026-10-07
- Rex, a Coding Agent Multiplexer, Opens Mailing List Invites for Early Testing — DanielLockyer · 2026-10-07
- Anaconda Combines Coding Agent Swarms and AI Attack Testing After Three Acquisitions — shashib · 2026-10-07
- Tracel builds a fully open-source Rust AI stack from kernels to serving — JosephJacks_ · 2026-10-07