Artificial Analysis 没被收买:自费 1.3 万美元实测各家模型
Antblue · reddit · 2026-09-11
针对近期「Artificial Analysis 已失效/被收买」的抱怨,作者逐点反驳:其智能指数是 10 项评测的加权聚合,多数评测有 arXiv 论文,仅 AA-Briefcase 为私有基准,聚合权重方法论完全公开。AA 自费独立跑分、不接广告,仅测试 Fable 5.1 就花了 13,129 美元,每个新模型都会测。
以 Deepseek V4.1-Flash 为例说明为什么只看总分 misses the big picture:这个 552B 模型总分(40)与 180B 的 Qwen 3.8-Flash-Next 相同,但分项显示它多数评测持平或反超,在 AutomationBench-AA(Agent SaaS 工作流)上甚至打败 GPT-6 Astra (Max),却在开源模型通常占优的 AA-Omniscience 非幻觉率上明显落后。模型有强有弱,这值得庆祝而非抱怨。
作者建议:先看分项评测、读评测论文、搞懂聚合方式,再来讨论。作者声明与 AA 无任何关联。
「模型」频道最新
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11