Artificial Analysis 推出端点精度指数:GLM-5.2 等模型 API 精度差异显著
ArtificialAnlys · x · 2026-08-05
Artificial Analysis 发布全新的端点精度指数(Endpoint Accuracy Index),衡量各 serverless API 端点保留开源模型精度的程度。首批覆盖 GLM-5.2、gpt-oss-120b 和 DeepSeek V4 Pro,Kimi K3 即将加入。
该指数以官方权重自托管部署为参考(100%),通过工具调用(BFCL-500)、科学推理(HLE-250)和长上下文召回(AA-LCR-25)三个等权维度评测,并给出置信区间。
关键发现:
- GLM-5.2:输出 token 限制严重影响精度,最严格的端点 HLE-250 得分仅为参考的一半或更低。
- gpt-oss-120b:工具调用处理差异大,部分端点 BFCL-500 得分 22%,而参考为 37%;服务配置改变模型行为,上下文窗口截断影响长任务。
- DeepSeek V4 Pro:多数端点与参考一致,官方端点表现良好。
所属事件:Artificial Analysis推出API端点精度指数(4 条相关)→
「Infra」频道最新
- 美国 NSF 斥资 1 亿美元建设区域性 AI 基础设施中心 — mkratsios47 · 2026-08-05
- Chutes AI 全面启用 TEE 验证,8x RTX 5090 算力性价比超专业卡 — markjeffrey · 2026-08-05
- engyai 上线 OpenRouter 最廉价 Kimi K3 API,成本降半 — const_reborn · 2026-08-05
- LiquidAI 新模型实测:Mac 本地跑 128K 上下文解码达 82 tok/s — helloiamleonie · 2026-08-05
- ai&携手Voltaiq:为日本AI数据中心部署电池储能系统 — DavidBennett__ · 2026-08-05
- 128GB 内存 Mac 跑本地大模型,哪款最适合写代码? — Electronic_Back1502 · 2026-08-05