Terminal-Bench 4.0 榜单更新,头部格局生变引关注
ns123abc · x · 2026-09-22
Terminal-Bench 4.0 榜单更新,发布者以「看看谁在霸榜」的方式引发关注。Terminal-Bench 是衡量 AI 智能体完成真实终端任务能力的评测基准,4.0 版本的排名变化意味着头部编程/智能体模型的相对位次出现新格局。具体榜单细节见原链接。
「模型」频道最新
- 曝 OpenAI 内部已基本自动化新实验模型训练流程 — arthurcolle · 2026-09-22
- 开源 Kev 决策模型家族:0.8B/4B/9B 本地可跑,9B 塞进 32GB Mac — khiladi1729 · 2026-09-22
- Grok 4.7 仍落后于 Muse,网友排前三:Fable、Astro、Muse — MicahBerkley · 2026-09-22
- Codex 移除 GPT-5.6 Sol 极速档,疑为 GPT-6 Sol 发布前兆 — imjustnewatai · 2026-09-22
- Mimo V2.6 输出¥2 对决 Grok 4.7 输出¥40,模型发布只走两端 — op7418 · 2026-09-22
- Grok 4.7 输出贵至 ¥40/M token,被便宜 16 倍的 MiMo V2.6 贴身对比 — 歸藏的AI工具箱 · 2026-09-22