斯坦福研究:同一模型 API 评测比聊天界面平均高 3.4 分,审计结果不可迁移

StanfordAILab · x · 2026-09-17

斯坦福团队(Jennifer Wang、Joachim Baumann、Daniel E. Ho、Sanmi Koyejo)发布 EMNLP 2026 论文,审计了 ChatGPT、Claude、Gemini 共 7 个系统、9 项基准,发现 API 评测分数无法可靠代表用户实际使用的聊天界面表现。

核心发现:

结论:评测报告应同时标注访问面(access surface)与模型名、日期;在 API 端点通过的审计,可能认证的并非大众实际使用的那个系统。

所属事件:斯坦福研究:API 审计结论难迁移至聊天界面(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →