GTR 无 softmax 循环视觉骨干:COCO 58.9 AP,RTX 4090 单帧 1.9ms
Intellindust · hf · 2026-10-05
Intellindust 提出 Gated Token Recurrence(GTR),一种免 softmax 的循环视觉骨干,结合门控线性注意力、交替空间扫描方向和空间增强 SwiGLU 块,解决全局 softmax 注意力随分辨率上升的二次方计算成本问题。
关键结果:
- 仅用 DINOv3 检测特化教师经最后一层 patch-token 对齐蒸馏,无需掩码预测或中间层监督
- 经 Objects365 检测预训练后,GTR-L 在 COCO val2017 达 58.9 box AP,RTX 4090 编译 FP16 单帧中位延迟 1.908ms
- 同一骨干可迁移至实例分割、姿态估计、旋转框检测、语义分割和单目深度估计
- 自研 chunkwise CUDA 算子在 1.6K tokens 时比 FLA v0.5.0 快 4 倍
- TensorRT 部署于 DRIVE AGX Thor,单帧中位延迟 2.282–8.769ms,适合边缘部署
「Infra」频道最新
- UBS 预测 2030 年 AI 机架容量增至 104.5GW,ASIC 份额将达 43% — AccBalanced · 2026-10-05
- 极客湾拆解麒麟 9050 Pro:双层堆叠逻辑折叠架构揭秘 — teortaxesTex · 2026-10-05
- 主权算力≠拥有硬件:作者称可切换供应商才是更好标准 — AccBalanced · 2026-10-05
- 麒麟 9050 Pro 实测:功耗仅高 0.4~0.6W,追平 3nm 旗舰能效 — teortaxesTex · 2026-10-05
- 测算:配 GB200/300 的 AI 数据中心每兆瓦造价高达 5720 万美元 — AccBalanced · 2026-10-05
- 每吉瓦聚变堆年可产 2 吨黄金,收入一半来自卖金 — anselm · 2026-10-05