冻结 Qwen2-Audio 不改权重,外部技能层把反诈 Macro-F1 拉高 32 点

FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection

Chengxian Hu, Zhiming Ma, Mingjun Pan, Yifan Wang, Shun Zhang, Qifan Wang, Zhilei Zhao, Yijin Zhou, Yuxi Zhao, Huiyuan Liu, Peidong Wang, Peng Chen

cs.SD, cs.CL

2026-09-16

FRAUDSkill 冻结 Qwen2-Audio-7B 权重,只优化外部技能程序、路由规则和选择器,完整系统在 TeleAntiFraud 上 Macro-F1 达 73.50%,比同模型基线高 31.96 点,非法输出从 36.04% 降到 1.94%。

这篇在解决什么

音频语言模型可以直接听电话、写理由,但上线反诈系统要的是封闭标签和固定决策链:先认服务场景,再判是否诈骗,只有判成诈骗才给诈骗类型。开场生成常常语义对、标签不对:「贷款服务」「假贷款诈骗」听着合理,却不在官方词表里,整条决策作废。

微调能把规则写进权重,话术或标注政策一变就要再训。手工提示更灵活,却很难保证三段输出合法且前后一致。需要一种不改音频模型、又能把开放生成按进封闭协议的适配方式。

方法

FRAUDSkill 把任务知识、标签约束和路由政策外置成可替换的技能程序,底层音频模型全程冻结。程序含三条:根指令规定角色、输出合同和官方词表;技能库存诈骗线索、类型边界和跨路由一致性规则;路由策略按当前步骤挑选要用的技能。

离线阶段用冻结的 Qwen2-Audio-7B-Instruct 在开发集上滚完整轨迹,文本批评模型诊断错标签、无法映射的输出、错误跳过的类型路由和少数类系统性错误,编辑器只改外部程序。束宽 3、分支 3、搜 5 轮,按验证集选出保留程序。部署时每条程序独立走场景-诈骗-类型链,确定性投影把别名收成官方标签,路由归一化强制「正常则类型为 NA、诈骗则必须给出类型」。多条轨迹再由验证集拟合的类别平衡选择器合成最终答案。

结果

评测单位是去重后的音频,TeleAntiFraud 官方 SFT 划分 10,711 训 / 2,677 测,其中 1,453 条带诈骗类型。所有冻结权重方法共用同一音频模型。

方法Macro-F1Joint Acc.Invalid
共享基线41.547.1036.04
SkillOpt37.675.9429.00
EvoSkill39.076.1634.19
FRAUDSkill-Text42.428.1834.48
FRAUDSkill73.5058.871.94
SFT(参考)66.06
SFT+Memory(参考)75.51

SkillOpt 和 EvoSkill 把非法输出压下去了,Macro-F1 反而低于基线。只做文本程序搜索的 FRAUDSkill-Text 平均 Macro-F1 42.42±1.39,增益 0.88 点小于种子波动。完整系统靠结构化推理拉起来:最佳文本程序 43.66,闭集投影 54.47,路由归一化 66.21,多路径 70.31,可靠性加权 70.84,类别平衡选择 73.50。W-F1 79.40,准确率 78.72。冻结权重的完整系统超过普通 SFT,略低于 SFT+Memory。

FRAUDSkill-Text 的场景错误率 74.2%,其中 91.1% 是缺标或超词表;诈骗路由错误 32.9%,假阴性占 60.0%;带标注的类型路由错误 83.1%。

为什么重要

对要按月改诈骗类型词表、又不能每次微调 7B 音频模型的团队,这条路更接近可维护。增益几乎全部来自闭集投影、路由约束和选择器,不来自把提示词再写漂亮一点。SkillOpt 式通用技能进化在这个任务上不够:格式变好,类别平衡判别可以变差。

它仍是渐进方案。协议绑在 TeleAntiFraud 的三段链上,换一套本体要重做投影和归一化,不是即插即用的通用音频分类器。

局限与存疑

文本层搜索不稳定,三颗种子的 Macro-F1 标准差 1.39,大于相对基线的平均增益。完整系统的 73.50 来自验证集选程序和选择器,论文把测试标签隔离了,但选择器族 Ωbal 的离散配置仍可能过拟合验证分布。SFT 两行缺 W-F1、非法率和联合准确率,和冻结方法不能逐项对比。评测按音频去重,和原数据集论文的 7,021 条交互记录不可直接比。底层模型固定为 Qwen2-Audio-7B-Instruct,没有换骨干的结果。

术语

原文与代码

相关论文

全部论文解读