Artificial Analysis 被指暗中调权重,压制开源模型登顶
Infinite-Local5435 · reddit · 2026-08-07
网友发帖质疑知名 AI 评测平台 Artificial Analysis(AA)的排行榜公正性。此前,开源模型 Qwen 3.8 max 曾登顶该平台的 Agentic 智能体指数第一名。
发帖者指出,AA 随后发布了「v4.1.1」版本的指数,通过调整 gdpval 和 t3 banking 等评测项的权重,成功将该开源模型的分数压低至 Anthropic Opus 之下。发帖者认为这种突然调整权重的做法有失偏颇,怀疑平台是受到了商业利益驱使。
「模型」频道最新
- DeepSeek寻求80亿美元融资,V4 Pro编码能力据称仅落后Claude 0.3% — imjustnewatai · 2026-08-07
- DeepSeek-V4 Flash 软件工程实测:性能达 GPT-5.6 八成 — zainhas · 2026-08-07
- 曝 Ilya 创办 SSI 已开始评测其首款新模型 — zephyr_z9 · 2026-08-07
- 实测DeepSeek-V4对比GPT-5.6:成本仅1/6,质量达80% — zainhas · 2026-08-07
- OpenAI 模型后训练再遭质疑,被指品味不足 — willdepue · 2026-08-07
- 闭源前沿模型陷入安全暂停,开源阵营宣称迎头赶上 — bindureddy · 2026-08-07