RT-SAFE 基准:8 个前沿 VLM 94.1% 到达目标,仅 0.7% 全程无安全事件

Lianhuiq · x · 2026-10-06

新发布的 RT-SAFE 基准提出:真实世界不会停下来等智能体思考,安全评测必须在「世界持续运动」中进行。基准在 Unreal Engine 渲染的动态 NYC 场景中,要求具身智能体沿人行道和斑马线导航到目的地,同时评测者持续记录规划期间的「被动碰撞」和执行后的主动碰撞、危险交互与交通违规。

这揭示了当前视觉语言模型在动态环境中的「能到达但不够安全」的巨大落差。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →