Artificial Analysis 发布智能指数 v4.3,引入私有测试集 AutomationBench
inductionheads · x · 2026-09-08
评测机构 Artificial Analysis 宣布其 Intelligence Index 升级到 v4.3,作为向 v5 过渡的一部分:
- Terminal-Bench 从 2.1 升级到 4.0,完成向最新版本的迁移
- 用 AutomationBench-AA 取代 τ³-Banking:这是基于 Zapier 商业工作流自动化 benchmark 的自实现版本,配有私有测试集,专注 agent 工作流自动化
官方说明每次变更都独立成立,目的是让指数保持对模型能力的有效刻画。引帖评论戏称此举类似 NCAA 在比赛中的操作,但对极客而言是实质更新。
所属事件:Artificial Analysis 智能指数升级 v4.3(4 条相关)→
「模型」频道最新
- 开发者辟谣 OpenAI Agent「越狱」:实为向 HuggingFace 发消息搜索 — danbri · 2026-09-08
- 语言学界回应 Gary Marcus:LLM 三年未带来新语言学概括 — GaryMarcus · 2026-09-08
- 开源平价模型大算账:10 美元订阅约合 3.7 万次 DeepSeek V4 Flash 请求 — teortaxesTex · 2026-09-08
- 个人 Blender 基准:GPT-6-Astra 一发脚本效果远超此前测试模型 — Gruku · 2026-09-08
- 同一提示词实测:ChatGPT、Google Stitch 与 Figma Make 谁更强 — Tegadesigns · 2026-09-08
- 一次会话生成踝关节 3D 交互解剖图,GPT-6 Astra 医疗演示惊艳 — DeryaTR_ · 2026-09-08