近域合法通话把反诈分类器从满分打到 0.65

TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection

Huiyuan Liu, Zhiming Ma, Yanxing Liu, Shun Zhang, Qifan Wang, Di Liu, Yifan Wang, Yuyang Deng, Haoyang Meng, Yijin Zhou, Yuxi Zhao, Chengxian Hu, Peidong Wang, Peng Chen

cs.SD, cs.CL

2026-09-16

TeleAntiFraud 2.0 用混合树生成每月 900 通冻结中文通话,近域合法负例把文本分类器 Macro-F1 从满分压到 0.65–0.68,并让多款音频模型塌成全判诈骗。

这篇在解决什么

电信诈骗话术变得很快,而且故意长得像客服、风控、核验电话。现有评测有两个坑。固定测试集吃不进发布之后才出现的新套路;负例如果来自完全不相关的话题,模型只要听出「这是银行或快递」就能把诈骗和正常分开,分数虚高。

TeleAntiFraud-28k 已经把反诈做成音频文本基准,但原文指出它不公开逐字稿、音频前缀还和标签相关,也没有足够的近域合法对照。需要一套能按月加新案例、又不改掉旧测试集的评测合同。

方法

核心是混合树反诈生成管线,再配上按月冻结的快照协议。

网上抓到的诈骗案例摘要先写成场景画像:双方身份、说服策略、风险节点。混合树在同一画像和开场下分叉,深度上限 4、每节点最多 3 个情节动作,叶子标成诈骗或非诈骗。兄弟路径共享参与者、场景和早期风险措辞,只在后来的动作上分道:一边把人导向官方核验,一边要远程拍卡、配合冻结威胁。标签跟着走完的轨迹走,不跟着话题走。

六智能体协作写对话:两个角色说话,分支和终止控制器管情节,两个表达状态代理管语气。Higgs TTS 3 再按角色配音。每月快照冻结 900 通中文电话,600 诈骗对 300 近域合法,连同音频、标签理由、提示词、模型回复和出处一起锁死。目前放出 June/V1 和 July/V2 两版。

结果

文本侧对照最干净。负例从无关通话、普通电信客服换成混合树兄弟路径后,词重叠从 0.005、0.161 升到 0.274;逻辑回归、SVM、RoBERTa 的 Macro-F1 从满分掉到 0.680、0.673、0.650。

同一套 TF–IDF+SVM,TeleAntiFraud-28k 的 ASR 文本 Macro-F1 还有 0.9950,2.0 的对话文本是 0.9286,ASR 测试掉到 0.7998,非诈骗召回只有 0.5800,预测诈骗比例 0.7878。

900 样本全量评测里,27 个 V1 配置有 11 个、去重后 27 个 V2 配置有 15 个呈现全判诈骗签名:诈骗召回接近 1.0,准确率贴着 2:1 先验,诈骗 F1 贴着 0.80。Gemini-Pro 直听音频在 6 月快照上是 0.790/0.654/0.980,还没完全塌;Qwen3-Omni、DeepSeek-V3、GPT-4o 的 ASR 路径多组是 0.800/0.667/1.000。把先验改成 1:2 时,全判诈骗基线的诈骗 F1 从 0.80 降到 0.50,平衡准确率始终是 0.50。

结构审计:813 条对话的 BGE 树内距离 0.0188、树间 0.3351;十位专家 1000 条判断与校正金标平均一致率 0.792。

为什么重要

这套基准把「会不会识别风险词」和「能不能看完后半段动作」拆开了。做音频反诈的人如果还在用不相关负例刷诈骗 F1,分数几乎没有信息量。可复现的做法是锁快照、报 Macro-F1 和两边召回、把原始预测存下来。

它是合成数据诊断仪,不是声称覆盖真实通话分布。对要上线的检测系统,更接近「会不会把合法风控电话误杀掉」这一类部署问题。

局限与存疑

作者自己写了:合成对话加 TTS,不能当成真实电话分布;目前只有两个月快照,谈长期漂移还早;参考音色 35 个里男 29 女 6,人口统计不均衡;对话质量是单标注员试点,80 条、1–5 分大约 4.1–4.6。专家一致率 0.70–0.88,难例并不少。全量榜上不少模型直接塌成全判诈骗,论文也没给出稳定可排的第一名。生成器本身若拿去训练,leave-one-tree-out F1 从 0.883 掉到 0.605,树泄漏是真风险。

术语

原文与代码

相关论文

全部论文解读