大模型评测不存在绝对公平:API封装层暗藏定制优化

steipete · x · 2026-07-31

针对“使用统一标准测试工具评估大模型”的做法,开发者揭示了其背后的不一致性:业界其实并没有绝对原生的标准测试工具。

所谓的统一测试,实际上是通过配置了一个 SDK 封装层,针对不同的模型应用了特定的设置。例如,Anthropic 使用了类似 Responses API 的自适应思考模式,而 OpenAI 则被设置为传统的 Chat Completions 风格。这种底层调用逻辑的差异,意味着跨厂商的模型评测很难做到真正的绝对公平。

所属事件:大模型评测标准受质疑:API封装层暗藏定制优化(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →