结构化T-bit替换像素输入,十万参数模型报ImageNet 88.1%

TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision

Sergey Kurinov, Alexey Upatov

Comexp Research Lab, TAPe + ML Project, Nizhniy Novgorod, Russia

cs.CV, eess.IV

2026-09-15

Comexp把像素换成专有T-bit关系图,用不到十万参数的模块化识别核,报ImageNet Top-1 88.1%、COCO mAP50-95 65.3;T-bit算法未公开,外部对照协议可能不同。

这篇在解决什么

工业里分类、检测、分割常常各养一条管线。YOLO、RF-DETR 能一把做检测和分割,但仍是像素张量进、大 backbone 撑,检测和分割的训练彼此喂不了对方。RF-DETR 的 backbone 还要先在 ImageNet 上预热,只为把检测撑起来。

像素管线其实在同时做两件事:从任意数字里重建图像结构,再解目标任务。DINOv2 用 1.42 亿张图,部分原因就是像素太不稳定。一张 30×50 的 RGB 小目标,按 8-bit 编码就有 256^4500 种原始取值。TAPe+ML 的主张是:先把图写成带关系的结构,再让很小的识别核去认,而不是把重建结构的负担继续堆进网络参数。

方法

TAPe(Theory of Active Perception)把一张图映射成一组 T-bit 和它们之间的边。T-bit 不是像素:它对应图像里最有信息量、彼此连着的一撮元素,数量远小于像素数。同一物体在光照、轻微形变、噪声下会得到相近的 T-bit 集合。论文只给出输入输出性质,构造算法按专有技术未公开。

v3 拆成协调器调度若干小模块,不再用单体检测器:

整套可训练参数不到 10 万。分类侧用坐标下降和 k-means 换掉学习率敏感的梯度头,论文报约 3 个百分点提升。新任务有 head-only、backbone 适配、从零三种模式;标完 10 到 15 张后可自动标其余图。分割走三步:先找有上下文意义的边界,再合成闭合多边形,最后把眼、纽扣这类零件并进主体。LVIS 提供正样本精细掩码,负样本来自全图划完的 panoptic COCO;backbone 预训只用约 5000 张图。

结果

下列数字按作者报告列出。论文写明,公开检测对照的训练和推理协议可能不同。

任务TAPe+ML v3对照
ImageNet-1k Top-188.1%,不到 10 万参数,从零训练DINOv2 ViT-g/14 约 86.92%(11 亿参数);DINOv3 ViT-7B/16 约 88.4%(70 亿)
ImageNet-ReaL89.9%ResNet-50 91.1%;DINOv3 90.4%
ImageNet-R / Sketch90.3% / 75.8%ResNet-50 81.3% / 30.9%;DINOv3 91.1% / 71.3%
COCO box mAP50 / 50-9584.7 / 65.3RF-DETR-2XL 78.5 / 60.1(1.269 亿参数)
COCO Mask mAP50 / 50-9580.7 / 58.4RF-DETR-Seg-2XL 73.1 / 49.9
Imagenette,同结构约 51.6 万参数 CNNTAPe 输入约 92%原图像素约 47%

视频切镜用 Interstellar 片段、同一套 HDBSCAN:TAPe 建索引 10 到 11 秒、索引小于 1 MB、聚类约 1 秒;DINOv2 ViT-B/14 在 16 核 CPU 上索引约 5220 秒、索引约 9.7 MB。工业传送带堵矿试点、30 张图:YOLO26s 约 28%,TAPe 只改头约 45%,连 backbone 一起适配约 65%;85 张约 85%;500 张加 NMS 到 85.7%–96%。GTX 1070 Ti 上检测段 10.8 ms/帧,含分割的全管线约 12 ms。LVIS 上按覆盖率计,额外训练后约 98.2% 的物体拿到有意义掩码,YOLO 不训 LVIS 时约 44%。iBot 式自监督在像素上 12 万张仍停在 loss 约 2.46,换成 TAPe 输入、9000 张就到约 0.406。

为什么重要

如果数字站得住,视觉的瓶颈就从「把网络做大」挪到「先把图写成带关系的码」。边缘侧和工业小样本会立刻有用:同一套核覆盖分类、检测、分割,新类可以按论文说法用几十张图起步。

现阶段还不能当可复现基线用。T-bit 怎么从像素算出来,论文明确不公开。从业者能拿走的是问题设定:把结构从网络参数里提前到输入层,以及模块化小模型加协调器这条工程路径。数字要等第三方在相同协议下复现,才谈得上跟进实现。

局限与存疑

作者自述:小物体紧框仍弱,卡在 mAP50-95 最严的 IoU 段;backbone 有 COCO 偏置,工业域必须适配 backbone;TAPe 完整算法不公开;没有做 3D 和带跟踪的视频检测。

更需要独立核验的是量级本身。不到 10 万参数、从零训练做到 ImageNet 88.1%,和现有公开小模型差了几个数量级。延迟表里 RF-DETR、YOLO 有的来自 T4 TensorRT 官方表,有的在 1070 Ti 上重测。10 万参数只计协调器加子模型,不含 TAPe 编码器本身的计算图。消融也不完整:子模型串联,无法干净拆掉某一级。在算法公开并按标准评测脚本复现之前,这些数字应按「作者报告」来读,不能当成已确认的新 SOTA。

术语

原文与代码

相关论文

全部论文解读