Terminal Bench 4.0 被点名:少数排名真实反映能力的评测

JJitsev · x · 2026-09-10

前 LMRA/Meta 研究员 Jürgen Schmidhuber 团队之外知名研究者 JJitsev 表示,Terminal Bench 4.0 和 Terminal Bench Science 0.1 是目前少数他看排名能相信反映模型真实能力的评测,且距饱和仍有空间,但下一代模型(半年到一年内)可能改变局面。他同时呼吁社区贡献、保持开源高质量运作。背景是新 SOTA 刚在 Terminal Bench 上刷新。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →