大模型评测标准受质疑:API封装层暗藏定制优化
针对当前大模型横评,开发者指出业界其实并不存在绝对原生的标准测试工具,所谓的统一测试往往通过配置 SDK 封装层来实现。此外,Anthropic 缺乏类似 OpenAI 的标准 completions 端点,其接口保留了思考过程。这些底层接口的不一致性导致大模型评测缺乏绝对公平性,亟需建立统一的评估框架。
2026-07-30 ~ 2026-07-31 · 2 条相关
- Anthropic API 缺乏标准补全端点,模型横评需统一框架 — altryne · 2026-07-30
- 大模型评测不存在绝对公平:API封装层暗藏定制优化 — steipete · 2026-07-31