Gradient-based Optimisation of Modulation Effects
Alistair Carson, Alec Wright, Stefan Bilbao
eess.AS, cs.LG, cs.SD
2026-01-08
可微 DSP 建模吉他调制效果器(频域训练、时域零延迟);损失低频加权破解延迟学习的局部最优,多款建模听感与真机无显著差异。
相位(phaser)、镶边(flanger)、合唱(chorus)这些吉他常用的调制效果,都靠低频振荡器(LFO)去拨弄信号的相位或延迟时间。要把一台模拟效果器(单块)用数字方式复刻出来,叫虚拟模拟建模(virtual analog modelling)。已有路线各有硬伤:纯电路仿真准但只能针对具体一台设备;黑盒神经网络通用但算得重、延迟高;RNN 方案对镶边那种较长的延迟时间学不准。可微分数字信号处理(DDSP)是个折中,用自动微分加已知的信号处理先验。这篇要把之前只做相位器的 DDSP 方法扩到镶边和合唱,并且做到训练在频域、推理在时域、零延迟。
核心难点在用梯度下降学延迟时间。一个延迟 D 的损失曲面,全局最优就在 D 处,但这个坑极窄,初始估计要是离目标超过约 1 个样本,梯度就会把你引到局部最优、给错答案。作者发现,给损失做低频频谱加权(或直接用低通输入信号),能把全局最优周围的凸区域展宽到约 N' 个样本宽,梯度法才走得动。对相位器用的全通滤波系数估计,低频加权就没那么一锤定音,全带优化反而在模拟相位器上有效。
模型在训练时是频域的:输入按帧(1024、2048、4096 点)加窗、做 FFT,每帧预测一个时不变的频响 hm,和输入帧相乘去逼近目标 STFT。LFO 用一张可学的查找表(M 个条目)表示,每个条目过一个小 MLP(1 层、宽 16、tanh);推理时再用波表合成把它延展到任意长度。频响由双二阶(biquad)滤波器、梳状滤波器、全通级联拼出,分镶边/合唱(线性相位延迟)和相位器(全通级联)两种变体,反馈回路里 biquad 可内可外两种开关位置。biquad 用状态变量形式,靠 FLAMO 库约束极点在单位圆内保证稳定。损失在频域算,带可选的预加重滤波;15k 步、Adam,每个实验跑 30 个随机种子,报中位数和 95% 置信区间。
先在一个已知答案的玩具任务(复刻自身的镶边/相位器配置)上验证:镶边必须用三角核当输入或预加重,否则只比「什么模型都不接」略好;相位器上全带 AP chirp 也能行。
真机上:
听感测试(MUSHRA 式,12 人参与、筛后 10 人)是亮点:
| 效果器 | 模型评分 | 真机评分 | 结论 |
| BF-2-A 镶边 | 92.9 | 98.8 | 无显著差异 |
| SV-1-B 合唱 | 95.0 | 98.4 | 无显著差异 |
| SS-A 相位 | 98.9 | 100 | 无显著差异 |
| SS-B 相位 | 98.3 | 98.8 | 无显著差异 |
| BF-2-B 镶边(有反馈) | 42.0 | 100 | 有差异,仅「一般」档 |
四个模型和模拟真机在统计上分不开;只有带长延迟加反馈的 BF-2-B 明显掉档,和客观指标一致。
对做音频效果建模的人,两个能直接拿走的东西:一是「训练在频域、推理在时域」的零延迟范式,适合实时;二是低频频谱加权这个小招,专治「用梯度学延迟时间」的局部最优。后者其实是个一般性的优化洞察:损失曲面在感兴趣的参数方向上太窄时,低通一下能拓宽凸域,让梯度法可用。对吉他、音频插件开发者,这套灰盒 DDSP 比黑盒网络轻、比电路仿真通用,代码、权重、音频样例都放了。
带长延迟和反馈的效果器(BF-2-B)仍是难点,模型系统性低估反馈量,作者试过在反馈路径再加滤波器但没成功。LUT 学 LFO 会过拟合到训练时长和帧率,推理靠波表合成兜底,前提是 LFO 周期性,对复杂非周期调制不成立。biquad 是无限脉冲响应,帧内可能仍有时混叠,作者假设它的衰减比延迟短。全通系数估计那部分,低频加权结论不一致,不同输入信号换来换去的结果得靠经验挑。听感测试的锚信号就是「原信号未加效果」,是个很弱的基线,被试也只有 10 人。频域训练本身只是个代理,它和时域推理之间的不一致,论文没完全量化。