Artificial Analysis 没被收买:自费 1.3 万美元实测各家模型

Antblue · reddit · 2026-09-11

针对近期「Artificial Analysis 已失效/被收买」的抱怨,作者逐点反驳:其智能指数是 10 项评测的加权聚合,多数评测有 arXiv 论文,仅 AA-Briefcase 为私有基准,聚合权重方法论完全公开。AA 自费独立跑分、不接广告,仅测试 Fable 5.1 就花了 13,129 美元,每个新模型都会测。

以 Deepseek V4.1-Flash 为例说明为什么只看总分 misses the big picture:这个 552B 模型总分(40)与 180B 的 Qwen 3.8-Flash-Next 相同,但分项显示它多数评测持平或反超,在 AutomationBench-AA(Agent SaaS 工作流)上甚至打败 GPT-6 Astra (Max),却在开源模型通常占优的 AA-Omniscience 非幻觉率上明显落后。模型有强有弱,这值得庆祝而非抱怨。

作者建议:先看分项评测、读评测论文、搞懂聚合方式,再来讨论。作者声明与 AA 无任何关联。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →