Artificial Analysis 情报指数 v4.3:引入 AutomationBench-AA 与 Terminal-Bench 4.0
SonglinYang4 · x · 2026-09-08
Artificial Analysis 发布 Intelligence Index v4.3:Terminal-Bench 从 2.1 升级到 4.0,并用自研的 AutomationBench-AA(基于 Zapier 业务流自动化基准、含私有测试集)替换 τ³-Banking。这是 v5 全面发布前的过渡版本,每个变更独立成立。转发者 EdwardSun0909 评论:如果模型在不同测量维度上都表现好,那可能就是真的好,而非单纯 benchmaxxing。
所属事件:Artificial Analysis 智能指数更新至 v4.3(6 条相关)→
「模型」频道最新
- 「没有LLM能解」的图像转动画难题,GPT-6 Astra最简提示解决 — BLUECOW009 · 2026-09-08
- 实测 Astra 用量超支:同一任务耗尽 5 小时额度仍未完成 — Grand0rk · 2026-09-08
- 博主实测新模型 Astra:迄今最接近 AGI 的使用体验 — haider1 · 2026-09-08
- 传 Google Astra 完整权重泄露,消息引发关注(未证实) — teortaxesTex · 2026-09-08
- 搭载 GPT-6 Astra 的 995 美元机器人零样本开柜门,滑手后自主重试成功 — DeryaTR_ · 2026-09-08
- 博主实测 Astra 生成定制着色器:表现惊艳到让人不安 — teortaxesTex · 2026-09-08