对比162个视觉模型:NeurIPS论文揭示表征趋同的普适维度
martin_hebart · x · 2026-09-25
Martin Hebart 团队(一作 Florian Mahner)被 NeurIPS 2026 接收的论文《Characterizing Universal Object Representations Across Vision Models》比较了 162 个视觉模型的物体表征结构。
核心发现:
- 团队将各模型的物体相似性结构分解为一组稀疏非负维度(方法称为 similarity-based representation factorization),并统计每个维度在不同模型间复现的频率,以此定义「普适维度」与「模型特有维度」。
- 普适维度更可解释、更多由图像的概念性/语义内容驱动;架构、训练目标、训练数据、模型规模与 ImageNet 性能差异均不能解释普适维度的出现。
- 拥有更多普适维度的模型能更好预测猕猴 IT 脑区活动和人类相似性判断,说明普适性与生物视觉表征相关;作者甚至展示将模型与人类对齐会使其维度更普适。
- 作者提出「普适性」可作为衡量 AI 与人类对齐程度的指标,未来可据此开发更符合人类表征的模型。
作者在推文线程中还逐一展开了方法细节、人类标注实验(普适维度更可解释)与结论。
「研究」频道最新
- 编程智能体做任务与运动规划:成功率 56%-95% 超越人工规划器 — FBK-NLP · 2026-09-25
- 研究:词性信息以分布式稀疏特征群形式编码于 SAE 潜空间 — colinglab · 2026-09-25
- 丰田研究 negative result:非高斯动作先验无助于微调大行为模型 LBM — _krishna_murthy · 2026-09-25
- 架构、数据与规模均无法解释视觉模型的普适表征 — martin_hebart · 2026-09-25
- SRF方法:从相似性矩阵分解出可解释低维表征 — martin_hebart · 2026-09-25
- Claude Code 自动科研 loop 发现新越狱算法,胜过 30+ 种 GCG 类攻击 — maksym_andr · 2026-09-25