2.2 万参数 ALPINE 靠自适应定位赢 5-shot,关系模块几乎没贡献

ALPINE: Adaptive Localization for Parameter- and Sample-Efficient Few-Shot Learning

Neeraj Yadav

cs.CV, cs.LG

2026-09-16

独立研究者做出仅 2.2 万参数的 few-shot 分类器 ALPINE,用 Gabor 能量做窗口化补丁定位。匹配 250 episode 时 CIFAR-FS 5-shot 为 56.39%,对照 ProtoNet 的 53.77%,关系模块贡献不到 1 个点。

这篇在解决什么

少样本图像分类的论文几乎只报准确率。对没有大规模算力的人,另外两轴同样硬:模型要多少参数,训到这个准确率要多少 episode。主流对比常常是几百万参数的骨干加几万次元训练。这篇把战场收窄到从零训练、250 个 episode、两万到五万参数这个档位。

出发点其实不是算力,是补丁网格本身。固定矩形格子会把一张脸、一条肢体切碎,或者把不相干的区域糊进同一格,遮挡和位移时更糟。假设换成按内容移动的补丁,对遮挡和位移会更稳,而且不必加参数。项目最初还想靠成对空间关系来建模「头属于身体」这类结构。后文的证伪实验把这个假设拆掉了。

方法

架构叫 ALPINE,实验配置名是 EXP-F3。一张图走四步。

固定的四方向 Gabor 滤波器(0°、45°、90°、135°,5×5,不学习)给出边缘能量图,同时当作额外输入通道。五个补丁槽位钉在四角加中心。每个槽位在能量图上做空间 softmax,再叠一个钉在自己锚点上的高斯窗,窗宽 windowfrac=0.5。补丁中心是这个分布的期望,再用双线性采样取出补丁。窗完全打开时五个补丁会塌到同一个全局能量峰;窗太死又几乎不移动。0.5 是折中。

每个补丁用一个很小的 CNN 编两档尺度,得到五个补丁向量。两两做差和 Hadamard 积,得到十个关系 token;再加四个固定内裁边界 token。一共 19 个 token 进一层 4 头自注意力,可学习 query 做全局汇总,再和均值池化的补丁向量做门控残差融合。分类头就是标准 Prototypical Network:类原型是 support 嵌入均值,query 用负平方欧氏距离。

规范配置嵌入宽度 16,22249 个可训练参数;加宽到 32 是 34917。基线 ProtoNet 47630、RelationNet 49617、MAML 49481。

结果

协议卡死:CIFAR-FS 和 MiniImageNet 上 5-way,恰好 250 个元训练 episode,5 个种子,每个种子 600 个评测 episode。MAML 在文献里通常要训几万 episode,这里的数字只是同预算对照,文中全部打了星号。

方法参数CIFAR-FS 5-shotMiniImageNet 5-shot
EXP-F3-35k3491758.67%53.81%
EXP-F32224956.39%53.37%
ProtoNet4763053.77%48.82%
RelationNet4961747.60%38.18%
MAML4948134.30%30.93%

5-shot 五个种子方向一致。1-shot 在 CIFAR-FS 上和 ProtoNet 基本打平(40.36% 对 40.45%),MiniImageNet 略高(35.88% 对 35.25%)。Wilcoxon 在 n=5 时最强只能到 p=0.0625,到不了常规 0.05。

50% 中心遮挡下 EXP-F3 的 MiniImageNet 5-shot 是 44.87%,ProtoNet 40.36%。25% 平移在 CIFAR-FS 上是统计平手(42.65% 对 43.61%),这是全文对 ProtoNet 唯一没赢的扰动条件。MiniImageNet 训练的 checkpoint 零微调转到 CUB-200-2011:EXP-F3 42.09%,ProtoNet 36.86%,掉点幅度接近(11.28 对 11.96)。RelationNet 只掉 1.77 个点,是因为它域内基线只有 38.18%。

样本效率曲线用了 3 个种子。MiniImageNet 上 EXP-F3 在前 50 个 episode 就过 45%,ProtoNet 要 100 到 150。

证伪实验更关键。推理时把十个关系 token 置零,5-shot 只掉 0.84 到 1.09 个点。从零重训一个没有关系模块的变体,掉 0.00 到 0.98 个点。容量扫描从 22k 到 196k,1-shot 在 35k 附近封顶,再加参数还会略降。给 ProtoNet 加上 LayerNorm 和 AdamW 反而变差(CIFAR-FS 5-shot 49.92%)。

为什么重要

给边缘设备和单机研究者一个明确参照:在这个参数和 episode 预算里,自适应定位比再堆一个关系模块更值钱。作者把五个种子的 checkpoint 哈希和复现清单公开了。

不要拿它去比当前 MiniImageNet 5-shot 的文献顶线。那一档常用更大、往往预训练过的骨干,大约 70% 到 81%。这篇明确说自己不参与那场比赛。

局限与存疑

1-shot 相对 ProtoNet 没有稳定优势,加到 196k 参数也解不开,三条诊断假设(嵌入噪声、空间压缩、softmax 置信度变平)全部测过,结果方向和缺口相反。MAML 对照不能当成「打败了充分收敛的 MAML」。评测只有 CIFAR-FS、MiniImageNet 和 CUB,分辨率固定 84×84。样本效率曲线只有 3 个种子。关系计算是项目的原始动机,作者自己的证伪实验说明它不是主因;最终模型仍留着这十个 token,因为有一点稳定的正收益。独立研究者单人工作,没有多机构复现。

术语

原文与代码

相关论文

全部论文解读