不同数据训练的模型收敛出相似概念几何,可否据此对齐?
cephaloform · x · 2026-10-10
Dominik Schnaus 分享了一个基于「柏拉图表示假说」(Platonic Representation Hypothesis)的直觉:用不同数据训练的模型,似乎会收敛到相似的内部表示几何。
在模型的嵌入空间中,食物、人物、动物等概念之间的距离分布看起来非常相似,暗示存在一种跨模型共享的概念几何结构。他据此提出开放问题:这种共享几何是否足以用来对齐不同模型(甚至不同模态)的表示?
这是一条偏直觉分享的研究向短帖,配图对比了两个嵌入空间中的概念距离。
「研究」频道最新
- COLM 最佳论文:Int-Bench 揭示 LLM 助手过早、过频干预有碍学习 — maxhkw · 2026-10-10
- Demis Hassabis:AI 最重要应用是改进医学与人类健康 — DeryaTR_ · 2026-10-10
- Group-Evolving Agents 获 COLM 2026 奖:SWE-bench 71% 超越人类设计框架 — xwang_lk · 2026-10-10
- 25 个脑区闭环实验:主流大模型脑活动对齐差异被隐藏 — ShahabBakht · 2026-10-10
- 学者自建 ICLR 2027 录用预测市场,用虚拟货币押注论文命运 — prof_kamilov · 2026-10-10
- 用进化式 LLM 程序搜索刷新 25 项正方形堆叠纪录 — tak3sh8 · 2026-10-10