RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models
Zijun Liao, Yian Zhao, Xin Shan, Yu Yan, Chang Liu, Lei Lu, Xiangyang Ji, Jie Chen
cs.CV
2025-10-29
北京大学把冻结的DINOv3-ViT-B只对齐到检测器最深层特征,再用梯度占比动态调节蒸馏强度。COCO上四个尺度达到49.7到57.0 AP,推理结构与延迟完全不变。
实时检测一直在轻量骨干和表征质量之间拉扯。YOLO 把单阶段管道推得很极端,RT-DETR 让 DETR 第一次能跟 YOLO 拼速度。再往上抠架构,收益变薄。轻量网络为了帧率砍掉高层语义。RT-DETR 的混合编码器里,只有最高层特征 S5 会做自注意力得到 F5,后续跨尺度融合和 query 选择都靠它,检测损失却要穿过 decoder 和 CCFF 才回流到 F5。论文把这个叫做 F5 semantic bottleneck。
DINOv3、CLIP、MAE 这类视觉基础模型语义很强,直接当骨干会把实时检测的延迟打爆。这条工作想在训练期把 VFM 的语义灌进轻量检测器,推理期教师和投影头全部扔掉。
学生仍是 RT-DETR 混合编码器:CNN 骨干出 S3/S4/S5,AIFI 只在 S5 上做自注意力得到 F5,再和浅层做 CNN 跨尺度融合。教师是冻结的 DINOv3-ViT-B。
Deep Semantic Injector(DSI)只对齐 F5。ViT 的 patch token 先 reshape 成二维,插值到 F5 的空间尺寸;学生侧用一个线性层把通道数对齐到教师。损失是各空间位置上的负余弦相似度,对齐方向、不对齐模长。消融很干脆:对齐骨干的 S3/S4/S5,或骨干加 F5 一起对齐,AP 都不涨;只对齐 F5 涨 0.5。线性投影优于 1×1 卷积和 MLP。余弦优于 MSE,DEIM-M、90 epoch 设定下 53.5 对 52.7。
蒸馏权重 λ 不能拍死。Gradient-guided Adaptive Modulation(GAM)每个 epoch 统计 backbone、AIFI、CCFF、decoder 的梯度 L1 范数,看 AIFI 占比 r。若 r 超出目标区间 [ρ−δ, ρ+δ],就按边界比例缩放 λ,把 AIFI 的有效梯度贡献拉回区间。静态 λ 扫到 20 时最好也只有 55.1 AP,GAM 到 55.4,前期收敛更快。
推理图里没有 DSI,也没有教师。参数量和延迟与同档 DEIM 完全一致。
COCO val2017,T4 上 TensorRT FP16。
| 模型 | 参数 / 延迟 | AP | 主要对照 |
| RT-DETRv4-S | 10M / 3.66ms | 49.7 | DEIM-S 49.0;YOLOv12-S 48.0 |
| RT-DETRv4-M | 19M / 5.91ms | 53.5 | DEIM-M 52.7;YOLOv12-M 52.5 |
| RT-DETRv4-L | 31M / 8.07ms | 55.4 | DEIM-L 54.7;YOLOv13-L 53.4 |
| RT-DETRv4-X | 62M / 12.90ms | 57.0 | DEIM-X 56.5;YOLOv12-X 55.2 |
对应 273/169/124/78 FPS。相对 DEIM,S/M/L/X 分别高 0.7/0.8/0.7/0.5 AP,结构和延迟不变。36 epoch 短训里 DSI 单独只涨 0.1–0.2 AP,加上 GAM 才到 +0.5。DEIMv2 把 DINOv3 直接当骨干,相近速度下更差:v2-S 50.9 AP @173 FPS,本方法 M 档 53.5 @169 FPS,也更难接到更大的教师。
这是训练期的免费午餐,不是新检测头。产线里已经部署 RT-DETR / D-FINE / DEIM 的人,可以在重训时挂上冻结 VFM,导出的引擎图不用改。教师规模和类型理论上可换,部署不会被锁在 Tiny/Small DINOv3 上。
增益是稳定的 0.5–0.8 AP,不是换代式架构。值不值得上,取决于你是否已经在这条 DETR 实时家族里,以及多半个点 AP 对业务有没有意义。
论文没有单独的 Limitations 节。主实验只挂了 DINOv3-ViT-B,讨论里写可换 MAE/CLIP,正文没有对照表。声称适用于 CNN 检测器,实验全在 DETR 实时家族上,YOLO 没做。GAM 的 ρ、δ 怎么选,只给了机制,没有完整敏感度表。短训消融 36 epoch、完整训练 50–120 epoch,两套数字不能直接横比。代码写「即将开源」,复现成本取决于每步都要跑一遍冻结 ViT-B。跟 DEIMv2 的对比被放到相近延迟,更大的 DEIMv2-X 仍然更高,只是更慢。没有报告遮挡或极端小物体上,DSI 会不会把教师偏见写进学生。