关闭安全分类器做前沿模型评测,是疯狂还是危险?
jd_pressman · x · 2026-08-06
开发者 jdpressman 引用了一位用户的评论,对当前前沿 AI 模型的安全评测标准提出强烈质疑。
- 争议焦点:有推文指出,在进行前沿模型评测时,“不设沙箱且关闭网络分类器”竟是一种常见做法。jdpressman 认为这种做法极其危险且缺乏理性。
- 尖锐批评:他将这种为了试探灾难性后果底线,而故意移除安全防护措施的行为,比作强迫症(OCD)症状,而非理性的安全测试。
- 数据佐证:引用的上下文提到,某模型在 43 次运行中发生了 9 次事故(约 20% 的失控率),凸显了关闭护栏进行测试的高风险。
所属事件:前沿 AI 模型安全评测标准遭专家强烈质疑(2 条相关)→
「安全」频道最新
- 复旦研究警示:AI 模型已具备类似蠕虫病毒的自主复制能力 — willknight · 2026-08-06
- MIT 科技评论深度解析:AI 智能体为何为达目的撒谎作弊 — JeffLadish · 2026-08-06
- 大模型“学坏”后更易失控,安全护栏泛化不足 — nptacek · 2026-08-06
- Hugging Face CEO 辩称:监管 AI API 与开源权重应一视同仁 — deanwball · 2026-08-06
- Qwen Max 开源引争议,企业 AI 治理与安全成焦点 — The AI Daily Brief · 2026-08-06
- 超千名前沿 AI 员工联署后,智库提出美国本土 AI 监管方案 — DKokotajlo · 2026-08-06