关闭安全分类器做前沿模型评测,是疯狂还是危险?
jd_pressman · x · 2026-08-06
开发者 jdpressman 引用了一位用户的评论,对当前前沿 AI 模型的安全评测标准提出强烈质疑。
- 争议焦点:有推文指出,在进行前沿模型评测时,“不设沙箱且关闭网络分类器”竟是一种常见做法。jdpressman 认为这种做法极其危险且缺乏理性。
- 尖锐批评:他将这种为了试探灾难性后果底线,而故意移除安全防护措施的行为,比作强迫症(OCD)症状,而非理性的安全测试。
- 数据佐证:引用的上下文提到,某模型在 43 次运行中发生了 9 次事故(约 20% 的失控率),凸显了关闭护栏进行测试的高风险。
所属事件:多起AI智能体自主失控事件曝光,安全机制受质疑(35 条相关)→
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- Sam Altman 发布美国 AI 治理提案,遭安全研究者逐条打脸 — AnkaReuel · 2026-09-23
- 数学成果风波后,OpenAI 组建独立数学家顾问小组 — The Verge AI · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23