Terminal-Bench 2.0 测试:最强模型仍有 10% 终端任务失败

YvesMulkers · x · 2026-08-13

在最新的 Terminal-Bench 2.0 评测中,48 个参与测试的 AI 模型里,GPT-5.6 Sol 以 91.9% 的最高分拔得头筹。然而,这意味着在旨在模拟真实终端工作场景(而非刻意刁难)的基准测试中,即使是表现最好的模型,依然有约 10% 的任务无法完成。作者借此提醒,在将其他模型投入生产环境前需谨慎评估其可靠性。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →