Terminal-Bench 4.0 榜单:GPT-6 Astra 以 57.7% 居首,Claude Opus 5 半价达 51.8%
shensi · x · 2026-09-17
据 Merge API 发布的 Terminal-Bench 4.0 付费模型排名:
- GPT-6 Astra 以 57.7% 领跑所有付费模型
- Claude Fable 5.1 紧随其后,成绩 55.8%
- Claude Opus 5 拿到 51.8%,但输出价格只有前者一半
发布方同时借榜单推销其 Merge Gateway,可按性能与成本目标把终端任务路由到合适模型。榜单数据来自第三方网关厂商,非官方发布,需注意其立场。
「模型」频道最新
- 曝 OpenAI 接近解决又一千禧年大奖数学难题 — Dr_Singularity · 2026-09-17
- 让模型画 PS5 手柄 SVG,它却自作主张建了个完整交互网站 — Angaisb_ · 2026-09-17
- 推算:DeepSeek 稀疏路线有望做到 40T 总参数、1T 激活 — teortaxesTex · 2026-09-17
- 爆料称 Kimi-K3 长期训练不足,或存算力投入差距 — scaling01 · 2026-09-17
- GPT Image 2.5 擅长图像去模糊,专用 API 又被通用模型吞掉 — shekitup · 2026-09-17
- GPT-6 Astra 18 小时通关宝可梦,却因苦力怕爆炸种了几小时土豆 — The Decoder · 2026-09-17