GLM-5.3-Flash 跃居开放权重模型第三强,复杂 Agent 任务表现更突出
AccBalanced · x · 2026-09-08
Artificial Analysis 发布 Intelligence Index v4.3:将 Terminal-Bench 升级到 4.0,并用自建的 AutomationBench-AA(模拟 Zapier 业务工作流自动化的私有测试集)替换 τ³-Banking。在新榜单中,GLM-5.3-Flash 成为第三强的开放权重模型,且在复杂 agentic 工作流基准上表现更为亮眼。
所属事件:Artificial Analysis 智能指数升级 v4.3,更换两项基准(8 条相关)→
「模型」频道最新
- 一天烧 7000 美元 API 费:数据分析把额度跑爆 — xeophon · 2026-09-08
- 圈内人看衰数据实验室:不亲自训练的数据厂商拿不住价值 — joecole · 2026-09-08
- 本地商用 MiniMax H3 要月付 5000 美元,德国小工作室直呼用不起 — jonask86 · 2026-09-08
- 圈内人推测 OpenAI Astra 被刻意训练为 RLM 架构 — xeophon · 2026-09-08
- 同一 Prompt 用 Blender MCP 复刻摩托,四模型横评 Astra 胜出 — a10ondr · 2026-09-08
- 每日简报:Mistral 融资 30 亿欧,Meta Muse 代理内测,DevDay 9 月 29 日 — testingcatalog · 2026-09-08