RoboHarm 基准测试:前沿机器人策略会拒绝危险指令吗
msadowski · hn · 2026-09-22
RoboHarm 是一个评测前沿机器人策略安全性的基准(robocurve.org/roboharm),核心问题直指要害:当用户提出不安全指令时,最先进的机器人模型会不会照做?
该项目系统测试机器人策略面对危险请求时的拒绝能力,把 LLM 领域成熟的安全对齐评测思路带到具身智能领域。HN 讨论指出,机器人端的安全护栏建设远落后于语言模型,这类基准为衡量各家机器人策略的安全底线提供了工具。
「安全」频道最新
- AI 改写论文闹出学术造假:奥斯曼选举根本不存在 — Afinetheorem · 2026-09-22
- 黄仁勋:先追究 AI 真实事故责任,再谈超级智能立法 — ccerrato147 · 2026-09-22
- 施密特谈 AI 暂停:各方激励冲突且无法验证,不会发生 — DavidSacks · 2026-09-22
- 开源 Rust 边车用原子文件锁防 MCP 工具调用重放攻击 — AdmissibilityScience · 2026-09-22
- 假投稿疑集中少数大学,研究者提议限制作者投稿数 — sarahookr · 2026-09-22
- LessWrong 长文:臭氧层空洞的治理奇迹能给 AI 安全什么启示 — LessWrong 精选 · 2026-09-22