Next.js Agent 榜:GPT-6 Sol 与 Opus 5.5 并列 97%,单价成本差 3 倍
pvncher · x · 2026-09-23
Vercel 发布 Next.js Agent Evals 最新榜单(2026-09-22),衡量 AI 编码 agent 完成真实 Next.js 任务的成功率。
榜首并列:GPT-6 Sol(Codex)与 Claude Opus 5.5(Claude Code)均达 97%,与 Claude Fable 5.1 持平;三者中 Opus 5.5 平均成本最低($0.234/任务),Fable 5.1 最贵($0.722)。
其他要点:
- Grok 4.7(OpenCode)94%,成本仅 $0.109,性价比突出
- Kimi K3、GLM 5.2、Claude Sonnet 5 等成功率 81%,但加 AGENTS.md 后全部可提升到 97%,说明项目上下文文件价值巨大
- MiniMax M3 最便宜($0.053),Cursor Composer 2.5 次之($0.062)
- 历史数据显示进步明显:Claude Opus 5(9月)94% 需 $1.96,而 Opus 4.6(4月)58% 仅 $0.204
发帖人评论认为单任务均价已低于 $0.25,逐项式 eval 已饱和,现在 agent 动辄运行数小时。
「编程与Agent」频道最新
- 把上下文当构建产物:Distill Lock 冻结输入、拒绝漂移、字节级可验证 — _akpiper · 2026-09-23
- 开源《Agentic Engineering Guide》:10 部分 33 章讲透 Agent 落地 — _akpiper · 2026-09-23
- 学编程仍不可省:John Crickett 论「动机+知识+技能+AI」的不等式 — iamKierraD · 2026-09-23
- 8GB 显存玩家的野路子:把 Qwen 聊天模板套到 Bonsai 2 上效果大增 — needthosepylons · 2026-09-23
- Handy 作者推出 pi-voice:给 Earendil Pi 加语音扩展 — mitsuhiko · 2026-09-23
- 实战指南:如何在编程 Agent 中调用 Gemini API 技能 — patloeber · 2026-09-23