同模型不同质量:端点准确率指数实测相差27%

ArtificialAnlys · x · 2026-08-21

Artificial Analysis 在旧金山举办最新一期「Inference, Measured」活动,探讨「同一个模型不一定是同一个产品」,话题涵盖 serverless 推理、Endpoint Accuracy Index 和 AA-AgentPerf。

其新推出的 Endpoint Accuracy Index 方法是:以 100% 自托管开源权重作为参照基准,用同一套三项评测衡量各服务商的推理端点,结果再相对参照打分。实测各家得分从 73% 到 100% 不等,差距显著。

研究指出量化、KV-cache 压缩和上下文限制都会影响实际输出质量,而这些差异并不会体现在定价页上。完整评测结果可在其官网查阅。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →