V4.1 在 Terminal-Bench-Science 拿 11/70,物理科学表现超 Opus 5
teortaxesTex · x · 2026-09-12
teortaxesTex 分析新泄露/评测中的模型 V4.1:在 Codex harness 下,它在 Terminal-Bench-Science 上拿到 11/70,远高于 Luna 和 Terra,且在物理科学子项上尤为突出,可与 Opus 5@CC 匹敌。引用帖指出这些成绩是用 Terminus 2 agent 跑的,在其他 harness 下可能不同;早期架构 checkpoint 上 V4.1 已呈 Pareto 最优,「whale」的新架构早期 checkpoint 表现相当亮眼。
「模型」频道最新
- 用户语音Agent首次反驳自己:GPT语音版会正面顶嘴了 — evielync · 2026-09-12
- kalomaze:模型迁移差非泛化缺陷,而是人类选题偏好所致 — kalomaze · 2026-09-12
- Sakana AI 发布 Fugu Ultra v2,多模型协同再登性能世界最高水準 — SakanaAILabs · 2026-09-12
- Grok 搜不到用户自己的推文,ChatGPT 一次找到 — SimonBalmain · 2026-09-12
- HSVSphere 吐槽 Opus 5 越用越慢:宁愿去读 Cisco 文档 — yacineMTB · 2026-09-12
- 反 AI 浪潮彻底失败:GPT 6 Astra 太火,OpenAI 承接不住需求 — Tolopono · 2026-09-12