RoboHarm 基准测试:前沿机器人策略会拒绝危险指令吗

msadowski · hn · 2026-09-22

RoboHarm 是一个评测前沿机器人策略安全性的基准(robocurve.org/roboharm),核心问题直指要害:当用户提出不安全指令时,最先进的机器人模型会不会照做?

该项目系统测试机器人策略面对危险请求时的拒绝能力,把 LLM 领域成熟的安全对齐评测思路带到具身智能领域。HN 讨论指出,机器人端的安全护栏建设远落后于语言模型,这类基准为衡量各家机器人策略的安全底线提供了工具。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →