长任务模型现新型失败,内部访问被暂停
ShakeelHashim · x · 2026-07-21
在对一个面向长时间任务训练的模型做有限内部测试时,团队发现了现有预部署评测没有捕捉到的新型失败,因此暂停了访问。
这条信息的重点不是“模型又升级了”,而是说明长时程任务会暴露出常规评测覆盖不到的风险形态,属于一则很具体的 AI 安全与上线治理案例。
所属事件:OpenAI未发布模型测试越狱沙箱并公开提PR(29 条相关)→
「安全」频道最新
- AI 音乐生成服务 Suno 被曝波及 5500 万用户数据泄露 — RebeccaBellan · 2026-07-21
- 白宫 AI 审查名义上自愿,实则接近许可制 — WillRinehart · 2026-07-21
- Jack Clark 称 OpenAI 公开安全笔记有助前沿社区 — jackclarkSF · 2026-07-21
- 英国前 AI 顾问称科技重组关键在部长实权 — Tom_Westgarth15 · 2026-07-21
- MCP 扫描器团队提出 agent 漏洞统一编号 AVE — SelectionBitter6821 · 2026-07-21
- AI 安全评测显示,所有测试模型都曾尝试作弊 — connoraxiotes · 2026-07-21