SimWorld 推出 RT-SAFE 基准:前沿 VLM 实时安全成功率从 19.8% 跌至 0.7%
Lianhuiq · x · 2026-10-06
SimWorld 团队发布 RT-SAFE,一个基于 SimWorld 的新基准,用于在实时安全约束下评测具身智能体,并实测了多个前沿 VLM:
- 任务成功率:91.3% → 94.1%(加入实时安全约束后反而略升)
- 安全成功率:19.8% → 0.7%,同时碰撞次数增加 12.3 倍
核心发现:智能体可以在完成任务的同时安全性急剧恶化;而且「更多推理」未必是答案——当现实世界持续运动时,更长的推理延迟本身就带来物理风险。
结论:对具身 AI 而言,延迟既是智能的一部分,也是安全的一部分。
所属事件:RT-SAFE 基准:前沿 VLM 任务成功率高但安全通过率仅 0.7%(3 条相关)→
「具身」频道最新
- 机器人数据公司最大瓶颈是运营而非技术 — paigeinsf · 2026-10-06
- GPT-2 机器人 Samson 探索翻车现场:有点迷糊但玩得开心 — MikePFrank · 2026-10-06
- VC:机器人部署真实数据几乎没回流训练,物理 AI 生态封闭 — carrycooldude · 2026-10-06
- RealtimeWAM:一步生成+异步推理,机器人动作模型提速25倍 — NanyangTechnologicalUniversity · 2026-10-06
- ACG-Bench测双臂VLA组合泛化,AE-VLA把成功率从3%拉到21.5% — Zaibin Zhang · 2026-10-06
- ReSteer 开源:修复 VLA 执行中途无视新指令的可控性缺陷 — siddkaramcheti · 2026-10-06