Terminal Bench 4.0 被点名:少数排名真实反映能力的评测
JJitsev · x · 2026-09-10
前 LMRA/Meta 研究员 Jürgen Schmidhuber 团队之外知名研究者 JJitsev 表示,Terminal Bench 4.0 和 Terminal Bench Science 0.1 是目前少数他看排名能相信反映模型真实能力的评测,且距饱和仍有空间,但下一代模型(半年到一年内)可能改变局面。他同时呼吁社区贡献、保持开源高质量运作。背景是新 SOTA 刚在 Terminal Bench 上刷新。
「模型」频道最新
- 网友算账:GPT 7 若赶在 GTA 6 前发布,将创 OpenAI 整数代最快纪录 — ChrisGPT · 2026-09-10
- 为什么模型数不对 strawberry:r 需逐个枚举而非目测 — ctjlewis · 2026-09-10
- Sarvam 推出实时流式语音转写 API,支持中途切换语言与毫秒级 VAD — itsOmSarraf_ · 2026-09-10
- 树搜索提示法测试 Astra 自主创造力,结果仍不及人工引导 — creatoroff · 2026-09-10
- 网友实测 DeepSeek 4.1 Flash:写游戏有玩家品味,天生爱快 — teortaxesTex · 2026-09-10
- 两周内 Meta 在 OpenCode 的 token 份额从 3.5% 暴涨至 45.4% — armand_ruiz · 2026-09-10