AFFMAE 登陆 ECCV:桌面硬件跑 1024px 预训练,推理提速 5 倍
CSProfKGD · x · 2026-09-07
加州大学圣迭戈分校(作者团队)在 ECCV 2026 发布 AFFMAE 论文:基于 CVPR 2023 的 AutoFocusFormer,用可微分的自适应下采样让模型学会只对图像中重要位置做 token 化,并据此前训练视觉模型,面向高分辨率显微镜图像分割。
关键结果:
- 学生 David Smerkous 对 AutoFocusFormer 做了大量代码优化,1024x1024 分辨率下推理提速 5 倍,内存占用降低 50%;
- 论文还开发了数值稳定的混合精度 Triton 内核与可复用为分割头的轻量 point-based decoder;
- 在足突宽度估计任务上,同等参数量下与 ViT backbone 的 MAE 微调性能持平,但预训练快 2 倍、峰值内存减半,微调吞吐最高提升 5 倍,让普通实验室在桌面硬件上就能做高分辨率预训练;
- 论文与代码均已开源,ECCV 现场 Poster Session 3 #74 展示。
「Infra」频道最新
- 「自托管 AI」的神话:本地模型仍绕不开云在环 — nomad-nostalgia · 2026-09-07
- 四卡 4090 本地跑模型:vLLM+P2P 补丁还是 llama.cpp 选谁 — dowitex · 2026-09-07
- AI 能否完全跑在手机上?端侧推理或颠覆 OpenAI 的收费模式 — kevinsurace · 2026-09-07
- 推理工程被严重低估:从 KV Cache 到 p99 延迟的完整技术版图 — techNmak · 2026-09-07
- Polymarket:年内有州通过数据中心禁令的概率达 73% — Polymarket · 2026-09-07
- 路州一家塔可店 40% 月营业额竟来自 Meta AI 数据中心 — Polymarket · 2026-09-07