TerminalBench-Fn 榜单:GPT-6 Sol 登顶 90.5%,Luna 成性价比之王
abeirami · x · 2026-09-30
Fidian 发布 TerminalBench-Fn 排行榜,用同一组 89 个任务同时跑 Terminal-Bench 2.1 和其加固变体 TB-fn,全部自测以保证跨模型可比。
- GPT-6 Sol (max) 在加固集 TB-fn 上以 90.5% pass@1 独占榜首,是史上最高加固集成绩;TB-2.1 上 87.7%,与 Claude Opus 5.5 统计持平。全程零拒绝零限流,pass@3 双集均超 95%。定价 $2.00/$10.00 每 MTok,加提示缓存每解决一个任务约 $0.52。
- Astra 和 Fable 等模型因拒绝部分网络安全任务而拉低排名,Sol 因此登顶。
- GPT-6 Luna (max) 是低配性价比之选:TB-fn 76.9% pass@1 排第 11,每解决任务仅约 $0.07($0.10/$0.50 每 MTok),处于成本效率前沿。
- 榜单用任务内 bootstrap 给出 95% 分数区间,排名区间重叠者视为同组,非严格排序。
「模型」频道最新
- 爆料称 6.1 sol 以四分之一 token 量超越 Opus 5.5 — polynoamial · 2026-09-30
- 曝 OpenAI 将推 GPT-6.1 Sol:接近 Astra 智能,价格仅五分之一 — Dr_Singularity · 2026-09-30
- topk 发布开源图文 embedding 模型,检索质量对标前沿仅 $0.05/1M tokens — lateinteraction · 2026-09-30
- 用 Jev 做搜索重排序:一次性搜索任务的高价值用法 — marktenenholtz · 2026-09-30
- Reddit 用户算账:OpenAI 订阅按比例升级定价明显多收钱 — Deadlywolf_EWHF · 2026-09-30
- 中国模型花小钱办大事,Reddit 热议中美 AI 训练效率差距 — budfischer · 2026-09-30