TB 4.0 榜单:GLM-5.3、Qwen 3.8、Muse 1.3、DeepSeek v4.1 领跑
himanshustwts · x · 2026-09-22
作者称 GLM-5.3、Qwen 3.8、Muse 1.3 和 DeepSeek v4.1 领跑 Terminal Bench 4.0 榜单,并表示会把相关模型放到同一批 evals 里做对比测试,后续可关注实测结果。
「编程与Agent」频道最新
- 星际争霸 Bench 实测:主流大模型打 RTS 全都不敌新手 — dotey · 2026-09-22
- LangSmith Gateway 上线决策模型:开源 SemIf 免费一周 — Hacubu · 2026-09-22
- 开发者把 typesafe 的 Jev 接入苹果 Foundation Models 框架,适配 Swift 应用 — rxwei · 2026-09-22
- LangSmith 上线 Jev-as-a-judge:低成本的评估方案 — airesearch12 · 2026-09-22
- Garry Tan 力荐新智能编码工具:大型 PR 处理快过 Codex 与 Claude Code — garrytan · 2026-09-22
- 用 GPT Vision + Jev 搭颜值打分器:三步流程实测与踩坑 — huangyun_122 · 2026-09-22