GLM 5.3 等 3 模型 Terminal-Bench 3 测试结果与 DeepSWE 表现相反
zainhas · x · 2026-08-22
数据显示,GLM 5.3、Fable 5 和 GPT-5.6 Sol 在 Terminal-Bench 3 的 pass@k 扫描测试中结果出人意料。这些模型在该基准上的表现与其在 DeepSWE 上的 pass@k 结果呈相反趋势。
「模型」频道最新
- Ox Alpha 单次生成 6.4 万令牌 Three.js 3D 场景代码 — rohanpaul_ai · 2026-08-22
- Ox Alpha模型实测:单次生成6.4万token构建3D场景 — rohanpaul_ai · 2026-08-22
- Codex 与 Claude 为何痴迷计算哈希值? — zhengyiluo · 2026-08-22
- 测模型猜人设:Claude 盘问本人,Grok 只刷推文 — repligate · 2026-08-22
- 依赖公共基准和舆论共识无法准确评估模型真实能力 — nptacek · 2026-08-22
- Opus 5 技能点侧重编程与哲学,意图理解能力突出 — davidad · 2026-08-22