不足 10 万参数的视觉系统 TAPe+ML 在 COCO 检测达 84.7 mAP50
Comexp · hf · 2026-09-22
研究团队发布 TAPe+ML v3,基于“主动感知理论”(TAPe)的结构化表示:在识别之前先编码感知元素之间的关系,而非直接处理像素张量,配合模块化识别架构统一完成分类、检测与实例分割。
- 规模:全系统参数少于 10 万
- COCO 目标检测:84.7 mAP50 / 65.3 mAP50-95
- COCO 实例分割:80.7 mask mAP50 / 58.4 mask mAP50-95
- 分类:同等训练条件下在 Imagenette 达 92% 验证准确率(对比原始像素基线),ImageNet-Real 达 89.9% Top-1
- 扩展性:还测试了视频场景检测的紧凑性与工业试点中的分布偏移适应
核心主张:把部分建模负担从网络参数转移到结构化输入表示,可以在更少数据、内存与算力下支撑紧凑的多任务视觉系统。
「研究」频道最新
- Berkeley 智能科学研讨会:重新概念化语言的演讲上线 — begusgasper · 2026-09-22
- Yarin Gal:多数 LLM 代写论文难经受时间考验 — yaringal · 2026-09-22
- 在 Isaac Sim 里估算 Unitree G1 关节发热:热损失可视化 — IsaiahBallah · 2026-09-22
- 拆解 Virtual Biotech:6 个设计决定如何撑起可审计 AI 药企 — bravo_abad · 2026-09-22
- LinearSolveBench 发布:考 AI 写 C 语言快速稀疏线性求解器 — hgarud · 2026-09-22
- Navier-Stokes 偏正则性定理被 agent 集群 36 小时内用 Lean 形式化 — RexDouglass · 2026-09-22