Terminal-Bench Science 上开源模型惨淡:最佳仅 4/70 分

teortaxesTex · x · 2026-09-12

Vals AI 上线 Terminal-Bench Science:由科研人员编写并审校的 70 道研究工作流任务,涵盖信号重建到模型校准,测试 AI 能否真正做科研。首批成绩差距悬殊:GPT 5.6 Luna 得 4/70 居首,DeepSeek V4.1、GLM-5.3、Grok 4.6 并列 3/70,Kimi K3 得 2/70,Qwen 3.8 Max 与 37B 仅 1/70,GLM 5.3-Flash 两版为 0/70。发帖人认为 OpenAI 已内部爬山优化此类任务,Anthropic 进展居中,Google 与 Meta 刚起步。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →