第三方 API 可能偷偷换模型:腾讯开源黑盒审计工具,用两个统计量查托管厂商保真度

Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs

Xiangfan Wu, Zonghao Ying, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

cs.CR, cs.AI

2026-08-17

把厂商路由建成随机过程,Ventor-QTest 只靠返回文本计数就能算平均保真损失 AFL 与极值保真损失 EFL;七条 DeepSeek 托管路由全查出偏离,EFL 高的路由长任务通过率掉 69 个百分点。

这篇在解决什么

买第三方托管的开放权重模型 API 时,你信的是厂商页面上那行模型名。但厂商可操作的空间很大:换推理引擎、batching 策略、数值内核,不声张地跑 FP8 甚至 FP4 量化,副本池里混着改过的配置,或者干脆挂羊头卖狗肉返回假元数据。更阴的是选择性路由:识别出审计流量就路由到忠实的模型,普通流量走便宜的替代品。这个生态没人系统性地量过,这篇要给出一个不依赖厂商配合的黑盒量法。

难处在:黑盒审计拿不到 logprob,只有返回的文本。同一 prompt 采样本征就有随机性,怎么区分「正常的采样抖动」和「路由到了另一个模型」?

方法

作者把一条路由(route,特定时间窗内的服务端点快照)建成随机过程,审计拆成两个组件,各报一个统计量:

两个量为什么都要?AFL 看典型行为,EFL 看尾部行为,两者可以互不排序。后面实验里恰好出现一条 AFL 低但 EFL 醒目的路由,单看均值会漏掉。

对标验证:在三条能拿到 logprob 的路由上,文本计数版 AFL 与 logprob 直接算的粗化 KL 对比,Pearson r=0.971,说明黑盒量法量到的东西与白盒量法一致(注意是描述性对齐,三条路由的排列检验不构成确认性证据)。

结果

对 DeepSeek V4 Flash 0731 的七条路由快照做审计(官方自检 + 六条第三方):官方路由 Sr=-0.0007,95% CrI [-0.0144, 0.0193],p=0.515,干净。六条第三方全部显著偏离:

路由AFL(Sr)95% CrI
Aliyun 07310.5704[0.4710, 0.6765]
StreamLake0.2950[0.2364, 0.3533]
Baidu Qianfan 07310.1875[0.1456, 0.2365]
Ark 07310.1591[0.1129, 0.2071]
DigitalOcean0.1250[0.0789, 0.1766]
DeepInfra FP80.1185[0.0782, 0.1611]

六条的 Holm 校正 p 都是 0.00035。EFL 侧 DigitalOcean 的尾部最重:500 步长序列绝对漂移中位数 0.00876、标准差 0.01676、20 条里的最大值 0.05960,官方对应 0.00545/0.00835/0.03498。StreamLake 反过来,中位数最小但标准差第二醒目,佐证 AFL 与 EFL 确实在量不同的东西。

下游对照是这篇最有意思的发现:七条路由的 GPQA-Diamond 准确率 69.7%74.7%,Wilson 区间互相重叠,与 AFL、EFL 都没有可检出关联。但 Terminal-Bench(每条路由 89 个长程 agent 任务)上,EFL 最重的 DigitalOcean 通过率从任务暴露量最低四分位的 82.6% 掉到最高四分位的 13.6%,差 20.6 个百分点(bootstrap 95% CI [-36.0, -4.5],单侧 p=0.0059)。解释是长程任务每步都是一次模型决策,轨迹越长,一次极值偏离毁掉全局的机会越多。选择题式的短任务对这个不敏感。

为什么重要

买第三方 API 的团队可以直接用:工具已开源,挂在腾讯 AI-Infra-Guard 仓库的 services/apichecker/ventorqtest 下。两个统计量互补的结论有直接操作含义:审短任务效果看不出差别,不代表 agent 场景没被降配;跑 agent 工作负载的团队该盯 EFL,不只是平均指标。对监管与采购侧,这是第一个把「选择性路由」正式写进威胁模型并提出可复数量法的开源审计方案。

局限与存疑

论文的界限陈述得相当克制:AFL 只在声明的类别映射与观测窗口内成立;EFL 是中心化意外度偏差,不是 KL 估计量,不提供模型保真的全序;20 条序列的经验分位数是描述性的;多项式标定假设请求独立,相关性路由与参考分布不确定性会让区间偏乐观。下游关联是探索性的,探针与 benchmark 的窗口不同步,不能做因果归因;完美识别审计流量的厂商依然防不住。

读下来还有一处保留:七条路由全是 DeepSeek V4 Flash 一个模型、一个时间窗的快照,AFL 数值(比如 Aliyun 的 0.57)多大程度能跨模型跨厂商比较,没有答案。第三方路由的参考分布用官方 API 估,官方 API 自己若有未披露变更,整条审计的锚点就漂了。

术语

原文与代码

相关论文

全部论文解读