斯坦福研究:同一模型 API 评测比聊天界面平均高 3.4 分,审计结果不可迁移
StanfordAILab · x · 2026-09-17
斯坦福团队(Jennifer Wang、Joachim Baumann、Daniel E. Ho、Sanmi Koyejo)发布 EMNLP 2026 论文,审计了 ChatGPT、Claude、Gemini 共 7 个系统、9 项基准,发现 API 评测分数无法可靠代表用户实际使用的聊天界面表现。
核心发现:
- 同一模型经 API 测得的准确率平均比聊天界面高 3.4 个百分点,测试-重测一致性高 2.1 个百分点。
- 对 ChatGPT 而言,API 与界面之间的性能差距,相当于 GPT 5.3 与 GPT 5.4 两个模型世代之间的差距——换一种访问方式,性能退化堪比降级一整代模型。
- 研究者尝试用系统提示、采样参数、推理设置等 API 侧控制项去复现界面行为,均无法可靠做到。端点与部署产品之间的中间层,审计者无法重建。
结论:评测报告应同时标注访问面(access surface)与模型名、日期;在 API 端点通过的审计,可能认证的并非大众实际使用的那个系统。
所属事件:斯坦福研究:API 审计结论难迁移至聊天界面(4 条相关)→
「安全」频道最新
- Anthropic 与 OpenAI 承诺引入驻场第三方安全评估员,独立性存疑 — RebeccaBellan · 2026-09-17
- Baseten 联手 Goodfire 与 ba labs,推动开源模型安全与可解释性研究 — JJitsev · 2026-09-17
- Curtis Yarvin 长访谈:AI 末日论是把人类疏忽误读成机器崛起 — ivan_bezdomny · 2026-09-17
- WIRED:华盛顿短期不会出台 AI 监管,白宫明确反对立法 — nordicinst · 2026-09-17
- Will Brown:AI 安全运动应借鉴环保运动,先拿出替代方案再谈限制 — willcb · 2026-09-17
- 认知科学家 Mel Mitchell:HF 黑客松 agent 的「忠诚」源自 RL 协作训练 — dhadfieldmenell · 2026-09-17