Perceptron 发布具身基础模型:10 倍视频预训练可换 10 倍遥操作数据
AI Engineer · youtube · 2026-09-24
AI Engineer 频道访谈 Perceptron AI 的 Armen Aghajanyan,讲解其具身基础模型的关键技术:
- 感知浪费问题:一小时视频约百万视觉 token,但损失只落在约 2%(仅有字幕或少量标注帧做监督);逐像素预测对背景像素和夹爪接触点一视同仁。Perceptron 的解法是「perceptive objective」,让模型学会预判哪些感知重要。
- 上下文膨胀:常开摄像头的 token 爆炸,patch 平均带来 10 倍压缩,再叠加 data-sparse mixture of experts 路由,按层决定读/跳过哪些 token;模型会自行放大图中的图表、分割水果时多花 token。
- 模型与数据:数周前发布的新模型在 PB 级数据(文本、图像、视频、桌面操作到游戏轨迹)上训练,自称以零头成本超越某前沿实验室的具身推理模型;检测被做成 agentic 任务(分块、放大、提对比度、迭代提框)。
- 新 scaling law:感知+推理+控制联合训练下,10 倍视频预训练可替代 10 倍遥操作数据(遥操作约 100 美元/小时)。
- 演示了单模型读书脊标题并输出控制 token 分拣书籍,承诺 7 月开源权重。
「具身」频道最新
- AI 时代消费电子创企 Inanimate 公开 Demo Day 视频,启动 WORKS 量产规划 — genmon · 2026-09-24
- 机器人公司 Ropedia 亮相 IROS2026,现场演示 HOMIE Gen2 人形机器人 — liuziwei7 · 2026-09-24
- 微软研究:把机器人推理卸载到边缘/云端,任务成功率与续航大幅提升 — Microsoft Research · 2026-09-24
- 云栖大会观察:具身 AI 正走出屏幕渗入日常产品 — Shruti_0810 · 2026-09-23
- 特斯拉 Optimus v3 渲染图疑从安卓 APK 泄露,外形近乎真人 — CyberRobooo · 2026-09-23
- Meta 今日将发布首款无摄像头智能眼镜,隐私争议升温 — Polymarket · 2026-09-23