预训练越早注入视觉 token 越好,未来所有 LLM 都将是 VLA
kamalgupta09 · x · 2026-09-07
作者 kamalgupta09 针对 Russ 给出的「用 VLM 预训练做底座的 policy 才算 VLA」定义提出反驳:
- 在固定的视觉+文本 token 预算下,视觉 token 越早注入预训练,最终模型不仅视觉任务更好,文本任务也更好(K2.5 等多项工作已验证)。
- 如今几乎所有 LLM 都在预训练早期就用视觉数据,把「底座用 LLM 预训练」来定义 VLM 同样是荒谬的。
- 类推:未来所有 LLM 都会在预训练早期加入 action 数据,因此它们全都会是 VLA——按动作数据出现时机来划 VLA 边界没有意义。
「模型」频道最新
- 让 AI 随机选 1-30 的数,多数模型都答 17 — ohnag_eryeah · 2026-09-07
- Polymarket 预测市场押注 Anthropic 本月发布下一代 Claude Opus,概率 82% — Polymarket · 2026-09-07
- GPT-6 Astra 实测:推理更强却耗更少 token,效率成最大亮点 — haider1 · 2026-09-07
- 网友晒 Astra 6 xhigh 自称「AGI」的截图 — viksit · 2026-09-07
- OpenAI 员工预测 Blender x Astra 到 2027 年中大幅进步 — Distinct-Question-16 · 2026-09-07
- GPT-6 Astra 跑通 71492 原子分子模拟,可拆解视角观察膜蛋白 — DeryaTR_ · 2026-09-07