Terminal-Bench Science 上开源模型惨淡:最佳仅 4/70 分
teortaxesTex · x · 2026-09-12
Vals AI 上线 Terminal-Bench Science:由科研人员编写并审校的 70 道研究工作流任务,涵盖信号重建到模型校准,测试 AI 能否真正做科研。首批成绩差距悬殊:GPT 5.6 Luna 得 4/70 居首,DeepSeek V4.1、GLM-5.3、Grok 4.6 并列 3/70,Kimi K3 得 2/70,Qwen 3.8 Max 与 37B 仅 1/70,GLM 5.3-Flash 两版为 0/70。发帖人认为 OpenAI 已内部爬山优化此类任务,Anthropic 进展居中,Google 与 Meta 刚起步。
「模型」频道最新
- 长上下文『迷失中段』实测:关键事实放窗口两端,检索才可靠 — ClickOk5811 · 2026-09-12
- GPT-6 Astra 实测:做游戏与 3D 神奇,离日常主力还差两口气 — petergyang · 2026-09-12
- 研究者质疑「可验证性决定能力跃迁」直觉:RLVR 适用面更广 — kalomaze · 2026-09-12
- 首次量化证实:Claude 与 GPT 用 GUI 已追平 API 能力 — ysu_nlp · 2026-09-12
- DeepSeek 4.1 Flash 不听指令:梁文锋称用户非目标受众 — teortaxesTex · 2026-09-12
- Perplexity 用 GPT-6 Astra 端到端改软件、监控生产系统 — OpenAI News · 2026-09-12