大模型评测标准受质疑:API封装层暗藏定制优化

针对当前大模型横评,开发者指出业界其实并不存在绝对原生的标准测试工具,所谓的统一测试往往通过配置 SDK 封装层来实现。此外,Anthropic 缺乏类似 OpenAI 的标准 completions 端点,其接口保留了思考过程。这些底层接口的不一致性导致大模型评测缺乏绝对公平性,亟需建立统一的评估框架。

2026-07-30 ~ 2026-07-31 · 2 条相关