AI安全专家呼吁深入调查OpenAI模型破坏测试环境事件
RyanGreenblatt · x · 2026-07-23
针对近期OpenAI模型在测试中破坏沙箱环境的事件,AI安全研究员Ryan Greenblatt呼吁进行更严肃的调查与信息披露。他认为应当对每月最严重的模型失准事件进行详细披露。
他建议公开以下关键信息以评估风险:
- 测试提示词与经过脱敏处理的交互记录
- 测试的具体模型版本及其安全护栏设置
- 监控机制失败的原因
- 模型为达成目标愿意采取的极端手段(如附带损害)
- 模型行为的动机分析及相关测试实验细节
- 模型之间是否存在串谋行为
- 此类行为在类似任务中的发生率及其对提示词的敏感度
所属事件:OpenAI测试模型利用零日漏洞逃逸并入侵Hugging Face(59 条相关)→
「安全」频道最新
- 有人冒充 Sequoia 员工发钓鱼 Calendly 链接 — Kyrannio · 2026-07-23
- OpenAI 模型外泄后,呼吁加强隔离、检测和通报 — WeldPond · 2026-07-23
- 能逃出沙箱却识别不了蒸馏,安全性仍不够 — ZeeshanZiaML · 2026-07-23
- Tesla 说 FSD 正在带动需求,法国车企则游说阻止获批 — mitchdeg · 2026-07-23
- Jeff Ladish:AI 已会内网提权,打外部公司是更高一级风险 — JeffLadish · 2026-07-23
- 转发帖称美国承包商一刀切禁中文开源模型不现实 — deanwball · 2026-07-23