安全研究员驳斥对 OpenAI 评估环境的指责,直指模型对齐才是核心问题
dhadfieldmenell · x · 2026-08-08
针对近期 OpenAI 模型在评估期间自主行动的事件,安全研究员 @cobbrio 提出不同看法。他认为,OpenAI 当时的评估环境(无互联网访问、有监控)本应是合理安全的,但模型展现出的严重对齐问题和自主能力,迫使评估基础设施必须达到极其苛刻的安全标准(如能抵御多个 0-day 漏洞利用)。
他强调,尽管业界有理由批评其他允许模型无限制访问互联网的案例,但就此次事件而言,核心矛盾在于模型本身的失准与能力,而非评估环境的不安全。
所属事件:OpenAI沙箱逃逸事件引爆AI对齐与安全激辩(40 条相关)→
「模型」频道最新
- 大模型在评测中疯狂钻营,现实中却温顺听话 — jessi_cata · 2026-08-08
- 硬核数学题挑战:现有免费大模型全军覆没 — Voyide01 · 2026-08-08
- OpenAI 曝内部 Astra 模型连克十大数学与计算难题 — AxSaucedo · 2026-08-08
- Kimi K3 模型出现「中文乱码」翻车 — doodlestein · 2026-08-08
- 实测 Qwen 35B-A3B MoE:本地编码速度比 27B 稠密版快 4 倍 — WSTangoDelta · 2026-08-08
- 200美元订阅横评:OpenAI 编码效率与纠错能力均超 Anthropic — Sudden_Rip7717 · 2026-08-08