ALPINE: Adaptive Localization for Parameter- and Sample-Efficient Few-Shot Learning
Neeraj Yadav
cs.CV, cs.LG
2026-09-16
独立研究者做出仅 2.2 万参数的 few-shot 分类器 ALPINE,用 Gabor 能量做窗口化补丁定位。匹配 250 episode 时 CIFAR-FS 5-shot 为 56.39%,对照 ProtoNet 的 53.77%,关系模块贡献不到 1 个点。
少样本图像分类的论文几乎只报准确率。对没有大规模算力的人,另外两轴同样硬:模型要多少参数,训到这个准确率要多少 episode。主流对比常常是几百万参数的骨干加几万次元训练。这篇把战场收窄到从零训练、250 个 episode、两万到五万参数这个档位。
出发点其实不是算力,是补丁网格本身。固定矩形格子会把一张脸、一条肢体切碎,或者把不相干的区域糊进同一格,遮挡和位移时更糟。假设换成按内容移动的补丁,对遮挡和位移会更稳,而且不必加参数。项目最初还想靠成对空间关系来建模「头属于身体」这类结构。后文的证伪实验把这个假设拆掉了。
架构叫 ALPINE,实验配置名是 EXP-F3。一张图走四步。
固定的四方向 Gabor 滤波器(0°、45°、90°、135°,5×5,不学习)给出边缘能量图,同时当作额外输入通道。五个补丁槽位钉在四角加中心。每个槽位在能量图上做空间 softmax,再叠一个钉在自己锚点上的高斯窗,窗宽 windowfrac=0.5。补丁中心是这个分布的期望,再用双线性采样取出补丁。窗完全打开时五个补丁会塌到同一个全局能量峰;窗太死又几乎不移动。0.5 是折中。
每个补丁用一个很小的 CNN 编两档尺度,得到五个补丁向量。两两做差和 Hadamard 积,得到十个关系 token;再加四个固定内裁边界 token。一共 19 个 token 进一层 4 头自注意力,可学习 query 做全局汇总,再和均值池化的补丁向量做门控残差融合。分类头就是标准 Prototypical Network:类原型是 support 嵌入均值,query 用负平方欧氏距离。
规范配置嵌入宽度 16,22249 个可训练参数;加宽到 32 是 34917。基线 ProtoNet 47630、RelationNet 49617、MAML 49481。
协议卡死:CIFAR-FS 和 MiniImageNet 上 5-way,恰好 250 个元训练 episode,5 个种子,每个种子 600 个评测 episode。MAML 在文献里通常要训几万 episode,这里的数字只是同预算对照,文中全部打了星号。
| 方法 | 参数 | CIFAR-FS 5-shot | MiniImageNet 5-shot |
| EXP-F3-35k | 34917 | 58.67% | 53.81% |
| EXP-F3 | 22249 | 56.39% | 53.37% |
| ProtoNet | 47630 | 53.77% | 48.82% |
| RelationNet | 49617 | 47.60% | 38.18% |
| MAML | 49481 | 34.30% | 30.93% |
5-shot 五个种子方向一致。1-shot 在 CIFAR-FS 上和 ProtoNet 基本打平(40.36% 对 40.45%),MiniImageNet 略高(35.88% 对 35.25%)。Wilcoxon 在 n=5 时最强只能到 p=0.0625,到不了常规 0.05。
50% 中心遮挡下 EXP-F3 的 MiniImageNet 5-shot 是 44.87%,ProtoNet 40.36%。25% 平移在 CIFAR-FS 上是统计平手(42.65% 对 43.61%),这是全文对 ProtoNet 唯一没赢的扰动条件。MiniImageNet 训练的 checkpoint 零微调转到 CUB-200-2011:EXP-F3 42.09%,ProtoNet 36.86%,掉点幅度接近(11.28 对 11.96)。RelationNet 只掉 1.77 个点,是因为它域内基线只有 38.18%。
样本效率曲线用了 3 个种子。MiniImageNet 上 EXP-F3 在前 50 个 episode 就过 45%,ProtoNet 要 100 到 150。
证伪实验更关键。推理时把十个关系 token 置零,5-shot 只掉 0.84 到 1.09 个点。从零重训一个没有关系模块的变体,掉 0.00 到 0.98 个点。容量扫描从 22k 到 196k,1-shot 在 35k 附近封顶,再加参数还会略降。给 ProtoNet 加上 LayerNorm 和 AdamW 反而变差(CIFAR-FS 5-shot 49.92%)。
给边缘设备和单机研究者一个明确参照:在这个参数和 episode 预算里,自适应定位比再堆一个关系模块更值钱。作者把五个种子的 checkpoint 哈希和复现清单公开了。
不要拿它去比当前 MiniImageNet 5-shot 的文献顶线。那一档常用更大、往往预训练过的骨干,大约 70% 到 81%。这篇明确说自己不参与那场比赛。
1-shot 相对 ProtoNet 没有稳定优势,加到 196k 参数也解不开,三条诊断假设(嵌入噪声、空间压缩、softmax 置信度变平)全部测过,结果方向和缺口相反。MAML 对照不能当成「打败了充分收敛的 MAML」。评测只有 CIFAR-FS、MiniImageNet 和 CUB,分辨率固定 84×84。样本效率曲线只有 3 个种子。关系计算是项目的原始动机,作者自己的证伪实验说明它不是主因;最终模型仍留着这十个 token,因为有一点稳定的正收益。独立研究者单人工作,没有多机构复现。