Terminal-Bench 2.0 测试:最强模型仍有 10% 终端任务失败
YvesMulkers · x · 2026-08-13
在最新的 Terminal-Bench 2.0 评测中,48 个参与测试的 AI 模型里,GPT-5.6 Sol 以 91.9% 的最高分拔得头筹。然而,这意味着在旨在模拟真实终端工作场景(而非刻意刁难)的基准测试中,即使是表现最好的模型,依然有约 10% 的任务无法完成。作者借此提醒,在将其他模型投入生产环境前需谨慎评估其可靠性。
「模型」频道最新
- Grok与Cursor展现帕累托优势,Anthropic被指合作困难 — GavinSBaker · 2026-08-13
- 安全信息严重滞后,新模型发布被批远逊同行 — dhadfieldmenell · 2026-08-13
- 推演 DeepSeek V4:超低 API 成本与 SSD KV Cache 革命 — Xianbao_QIAN · 2026-08-13
- 通义千问发布Qwen3.8-Max:2.4T参数,原生支持1M上下文 — Scobleizer · 2026-08-13
- Grok 4.6 定价极具竞争力,Cursor 订阅面临压力 — Rasmic · 2026-08-13
- 曝 V4 GA 评测流出:安全护栏大幅放宽,仍需强化学习突破 — teortaxesTex · 2026-08-13