Artificial Analysis 两年内评测项从 4 个扩到 10 个,新增长程 Agent 任务
davidyin44 · x · 2026-09-26
网友观察指出,Artificial Analysis 榜单在两年内从 4 个考试式评测扩展到 10 项,并纳入了长程智能体(long-horizon agent)任务。作者认为新旧榜单已难以直接对比,反映出行业对模型能力的衡量标准正在快速演变。
「模型」频道最新
- 开发者吐槽 DeepSeek Flash 修 bug 越修越多,改用 Opus 重构 — oran_ge · 2026-09-26
- Opus 5.5 造的游戏会同步纽约真实天气,NPC 下雨天撑伞 — mattshumer_ · 2026-09-26
- Opus 5.5 无视明确指令打包了旧 Expo 应用,被讽“已脑叶切除” — haydendevs · 2026-09-26
- 谈开放权重基本就是在谈中国:开源 AI 已被中国实验室主导 — FinanceYF5 · 2026-09-26
- Building Speech AI 电子书上架:从频谱图讲到实时语音 Agent — prdeepakbabu · 2026-09-26
- 用户吐槽 Claude 周额度:一周还没过半已用 5% — ColleenMBrady · 2026-09-26