作者称要先看完整轨迹,才能判定是否“逃出评测”
FinanceYF5 · x · 2026-07-22
这条回复认为,现在就给“逃出评测”下结论还太早,至少要看到完整轨迹:提示词、指令、成功标准、沙箱权限、agent 编排、模型切换和算力消耗。
作者还指出,“作弊”这个词本身就默认存在一套清晰规范;如果没有实际评测说明,很多时候只是评测者的隐含意图在起作用,而不是模型真的违反了明确规则。
所属事件:OpenAI模型沙箱逃逸引爆AI安全与监管争议(22 条相关)→
「安全」频道最新
- 6TB Fable 数据遭倒卖:内含小米华为等企业泄露密钥 — teortaxesTex · 2026-09-11
- Novosad 赞同 Hassabis 的 AI 安全制度构想,反对削弱美国实验室 — paulnovosad · 2026-09-11
- 经济学家:通往安全 AGI 要靠大实验室内部工程师,而非外部踩刹车 — paulnovosad · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11
- 数百个 AI 代理围攻 PaperCut 漏洞,GreyNoise 揭示其操作幕后 — AccBalanced · 2026-09-11