人耳听不见的 5–20Hz 声波能把音频大模型打掉最多 67 个百分点

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

Yuanhe Zhang, Weiliu Wang, Jie Ren, Liang Lin, Zhenhong Zhou, Haoran Gao, Kun Wang, Chen Li, Li Sun, Sen Su

cs.SD, cs.AI

2026-08-10

ILL 用一条通用低频波形黑盒攻击 6 个音频大模型,可听噪声占比仅 0.08% 却最多降 67pp;DRG 靠频谱分布检测加重录,把均值从 28.5% 拉回 46.1%。

这篇在解决什么

音频大模型(LALM)的输入面由模型的前端定义,不由人耳定义。人耳公认听不到 20Hz 以下的声音,但商用麦克风在 0.5–20Hz 仍有响应,这意味着一条人耳完全听不见的低频信号可以进入模型并影响输出。此前对 LALM 的红队测试集中在恶意语音和听得见的噪声,低频这条隐蔽通道没人系统测过。北邮联合中科院信工所、NTU、腾讯的团队补上了这块:先造攻击,再造防御。

方法

攻击叫 ILL(Intermittent Low-Frequency Lockout),黑盒、通用波形:离线用一个参考语料库加一个参考模型(Qwen2.5-Omni)构造一次,之后同一份波形打所有目标、所有语句,不需要访问目标模型。

防御叫 DRG(Distributional Requery Guard):推理前先算输入的归一化频谱分布,和两组 K-means 中心比距离(低频质量大的那组判为受干扰),命中就要求用户重录一遍,让模型对比两份录音、只按一致且清晰的内容作答。整个检测只有两次 V 维距离计算,不跑神经网络,也不查询目标模型。

结果

6 个 LALM(Qwen2.5-Omni、Qwen3-Omni、MiniCPM-o 4.5、StepAudio2 Mini、GPT-audio-mini、Gemini-3.5-flash),四类任务(MMAU 音频问答、LibriSpeech 识别、CoVoST2 翻译、RAVDESS 情感分类)。

设置可听噪声占比人类可听度评分(1–7)
干净音频0%1.17
高斯/自然噪声等可听基线>98.9%3.75 起
ILL0.06–0.08%1.33

最大单点杀伤在 StepAudio2 的情感分类:75% 掉到 8%,降 67 个百分点,而 StepAudio2 恰恰是构造波形时没碰过的模型,黑盒迁移性得到直接验证。消融显示破坏力来自结构化状态序列,不是低频能量本身:同幅度下,高斯噪声、固定频率、均匀扫频都明显更弱。内部指标上,音频注意力质量、表征余弦相似度(1.0→0.63)、正确答案概率(0.824→0.018)同步塌陷,DRG 都能部分拉回。防御侧,DRG 检测 F1 89.69–99.00%,干净重录后六模型平均准确率从 28.5% 升到 46.1%;强行对干净输入也触发重录,12 项里 10 项指标变化不超过 0.03,良性代价小。

为什么重要

对做语音助手、语音 agent 的团队,这是一条新的可用性攻击面:不需要改音频文件,现场放一个低频源就行,用户全程无感。DRG 的「检测加重录」成本极低,可以直接挂进现有管线。更广的意义在评测方法:用注意力统计定节奏、用语料频谱统计定内容,这套构造对其他模态里「人类感知不到、模型吃得到」的通道也有参考价值。

局限与存疑

作者明确说实验模拟的是麦克风收到的信号,没有复现扬声器到真实声场再到麦克风的完整物理链路,发射功率、传播损耗、设备差异都留给后续受控物理实验。机制分析是相关性证据(注意力、表征、置信度同步变化),不是因果链。部分基线本身成绩很低(如 GPT 在 RAVDESS 干净只有 9%),在这些点上掉的百分点参考意义有限;ILL 也并非在所有设置里都赢过可听噪声基线,论文自己把卖点收窄为「仅用 5–20Hz 频段就能造成广泛退化」。

术语

原文与代码

相关论文

全部论文解读