Not All Objectives Are Born Equal: Priority-Constrained Descent for Hierarchical Multi-Objective Optimization
Dara Varam, Mohamed I. Alhajri
cs.LG, stat.ML
2026-06-29
提出Priority-Constrained Descent,把更新钉在主任务梯度上,用单一标量τ保证次目标一阶进度。ResNet-34在CIFAR-100上90%结构化稀疏仍保70.9%,对称方法MGDA掉到接近随机的1.2%。
深度学习里多数「多目标」并不对等。分类精度是交付物,稀疏、低秩、量化保真都是次约束。标准做法仍把它们当成可互换的任务:加权求和,或者像 MGDA、PCGrad、CAGrad 那样在梯度凸包里找折中方向。这些方法瞄准 Pareto 平稳点,原点一旦落进各目标梯度的凸包就停。
停在那里对层次问题是失败。梯度互相抵消时,没有任何一个目标单独平稳,论文把这种点叫冲突平衡。二维玩具里,加权和、MGDA、PCGrad、CAGrad、FAMO 都卡在 L2 还没到零的鞍点前。PCD 穿过障碍,走到 ∇L1=∇L2=0 的复合双平稳点。
PCD 把主梯度当成锚,次目标当成半空间约束。对 EMA 归一化后的梯度,求离主梯度欧氏距离最近、又让每个次目标至少拿到 τ 份额一阶进度的方向:内积至少达到 τ 乘上次梯度范数平方,τ 落在 0 到 1。
几何上就是把主梯度投影到次进度多面体上。主目标系数钉死为 1,次目标只以非负乘子进来,约束没绑定时乘子为零。主方向自己已经够次目标进度时,PCD 退回对主损失的普通梯度下降。
τ 是唯一旋钮。小 τ 几乎不偏主方向;大 τ 把可行域往外推,偏转加大。两目标有闭式:约束激活时沿次梯度补上刚好够用的分量。K=2 时,这个二次规划在原始梯度上就是 Gong 等人 2021 年的 Dynamic Barrier。PCD 多出来的是按目标做尺度归一化,让同一个无量纲 τ 能跨异构次目标使用。
梯度用 Adam 式的偏差校正二阶矩做逐目标缩放。把某个损失乘上常数,稳态下归一化梯度不变。加权和做不到:同一个权重会随正则项量级在 Pareto 前沿上滑走。合成实验里次目标从 10⁻⁴ 缩到 10⁶,PCD 工作点在原单位上只散开 0.0075。
保证只贴在算出来的方向上。实际部署把该方向缩放到主梯度范数再交给 Adam,论文没有给部署算法的收敛定理。主梯度为零时缩放因子把更新打成零,部署不动点可以停在仅主任务平稳的位置。330 次、每次 300 epoch 的调参实验里,主梯度最小也只到 4.7×10⁻⁴。
结构化剪枝把交叉熵当主损失、通道级 Group Lasso 当次损失,训完按组范数阈值去掉滤波器,不微调。四个结构,CIFAR-10 与 CIFAR-100,Adam,300 epoch,5 个种子。
ResNet-34 / CIFAR-100,未剪 73.3%:
| 方法 | 80% 稀疏精度 | 90% 稀疏精度 |
| PCD | 73.0% | 70.9% |
| AuxiNash | 44.4% | 44.4% |
| 加权和 | 27.3% | 27.3% |
| PCGrad / CAGrad | 7.4% / 7.3% | 7.4% / 7.3% |
| MGDA | 1.2% | 1.2% |
对称方法在训练中就把组稀疏推到 99.3% 到 100%,剪枝只是揭开已经废掉的网络。PCD 逐步限制次进度,原生稀疏被挡住。DenseNet-121 / CIFAR-10 上,τ=0.01 时精度 94.0% 对未剪 94.5%,FLOPs 降 5.3 倍、延迟 1.8 倍、体积 9.4 倍;τ=0.05 时精度 89.2%,FLOPs 降 45.4 倍、体积 83 倍。
对照调过的剪枝专用基线(对数网格 Group Lasso、proximal Group Lasso、Cooper、DBGD 的 β 与 α 两支),压缩带(原生组稀疏至少 85%)47 组匹配里 PCD 赢 28、输 1、种子噪声内 18。唯一一次输出现在 ResNet-34/CIFAR-100:调参标量化在 98.1% 稀疏拿到 53.8%,PCD 在 97.9% 拿到 51.9%。同一旋钮 τ=β=0.01 时,PCD 相对稠密模型的精度保留跨四个配置只差 1.09 个百分点,DBGD 差 13.23 个。
三目标设定把交叉熵、ℓ1、核范数绑在一起,τ 固定 0.02。ResNet-34/CIFAR-100 上 PCD 精度 71.0%、非结构化稀疏 92.6%、有效秩 24.5;最强基线 AuxiNash 是 48.7%、98.8%、184.8。超体积上 PCD 压过全部基线,ResNet-34/CIFAR-10 上 35.4 对次强约 13.1。
冲突平衡逃逸实验里,PCD 把主梯度收到约 10⁻¹⁵、主损失约 10⁻²⁹;MGDA 和 CAGrad 钉在 1.536√(K−1) 的定律上,K=5 时停在 3.07。1785 次随机次梯度构型里二次规划零次不可行。
剪枝、低秩、量化感知训练这类「主任务加结构正则」问题,PCD 把超参收成一个有几何含义的 τ,不必再扫脆弱的权重比。闭式解覆盖两三个目标,每步额外成本是一个 K×K 二次规划,相对 K 次反传可以忽略。
这是层次多目标上的几何改写。剪枝流水线本身没有换。实验协议刻意排除微调、逐层缩放和随机门,和 Network Slimming、幅度剪枝加微调走的是不同产品路径。CIFAR 上的小模型也还没回答 ImageNet 或大 Transformer 上好不好用。已经在用 Group Lasso 或核范数的人,可以先在现有损失上把优化器方向换掉试一轮。
论文自己写明:没有部署算法的收敛定理,保证只对归一化方向成立。部署缩放让主梯度为零变成不动点。自适应优化器走出来的参数步不必保持约束符号:Adam 下符号保住 92.3% 到 99.8% 的步,带动量的 SGD 有 47% 到 73% 的步会翻号,两边却落在同一条精度与稀疏前沿。K>2 时次约束可能互斥,实现上该步丢掉次约束、退回主梯度。次目标被假定为凸。自动微分在次微分含零时不一定返回零,复合多平稳的识别依赖这个 oracle 假设。没有公共平稳点的真权衡问题上,τ>0 的 PCD 方向没有不动点,迭代不必收敛。
合成逃逸实验可沿各方向分离,PCGrad 在 K≥3 时也能到复合多平稳,压缩曲面上它全程落后。对照不含微调幅度剪枝。MobileNetV2/CIFAR-100 在 99% 目标上加权和 1.9%、PCD 1.2%,两边都已崩。τ 在多数配置上落在 0 到 0.1 最好用,ResNet-34/CIFAR-100 上超过 0.1 精度掉得很快。旋钮可解释,不等于不用扫。