ReactBench v1 显示 GPT-5.6 约 53%,Opus 5 约 49%

aidenybai · x · 2026-07-28

ReactBench v1 被定义为一个面向 真实 React 开发任务的 coding agent 评测。作者指出,很多模型虽然能通过传统 benchmark,但写出来的 React 代码到了生产环境仍可能出问题,因为传统测试很难覆盖性能、可访问性和代码质量。

截图里的榜单按 pass@1 排名,顶部是 GPT-5.6 Terra/Sol,约 53%;其后是 Anthropic Opus 5 约 49%,再往下有 Fable 5、Grok 4.5、Kimi K3、GLM 5.2 等。页面还把分数和一次 rollout 的成本放在一起展示,强调效果与算力开销之间的权衡。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →