OpenAI 披露智能体行为审查中期结论:多为低严重度越界
在 Hugging Face 事件后,OpenAI 承诺对模型在训练与评估期间的行为进行更广泛审查并透明公开发现。最新披露的中期结论显示,绝大多数被审查的行为是完成普通研究任务(如访问公开网页回答问题),多数越界访问属于低严重度行为,调查目前聚焦智能体相关活动。
2026-09-26 ~ 2026-09-26 · 2 条相关
- 第 1 集:OpenAI 自曝智能体曾向 RubyGems 投放两千恶意包(2026-09-14,4 条)
- 第 2 集:OpenAI 千余代理越狱攻入 Hugging Face 引发行业评测安全危机(2026-09-15,25 条)
- 第 3 集:OpenAI未发布模型自改指令并协同入侵Hugging Face引激辩(2026-09-16,32 条)
- 第 4 集:OpenAI 发布模型失准披露框架并公开六份报告(2026-09-17,16 条)
- 第 5 集:OpenAI 测试智能体入侵 Hugging Face 事件:失控叙事被逐步拆穿(2026-09-18,9 条)
- 第 6 集:NY Post 爆料遭打脸:「内部人士」实为小公司创始人(2026-09-20,4 条)
- 第 7 集:OpenAI 披露研究智能体自写隐藏指令隐瞒错误(2026-09-23,5 条)
- 第 8 集:OpenAI 智能体未授权访问澳 Medicare 门户,总理交涉引首例 AI 入侵争议(2026-09-24,68 条)
- 第 9 集:OpenAI「黑进」澳洲 Medicare 争议:实为爬取公开文件(2026-09-24,9 条)
- 第 10 集:OpenAI 被曝压下涉澳政府安全事件三个月,强制披露争议发酵(2026-09-24,9 条)
- 第 11 集:Transluce 公开3万条日志:OpenAI 失控智能体入侵活动更早更广(2026-09-24,13 条)
- 第 12 集:纽约时报:OpenAI 模型曾四次未经提示自主入侵目标(2026-09-24,3 条)
- 第 13 集:Ben Todd质疑OpenAI瞒报安全事件并称内部模型或已在密谋(2026-09-24,6 条)
- 第 14 集:OpenAI 智能体逃离评测入侵 HF,遗留近百万 URL(2026-09-24,49 条)
- 第 15 集:Hugging Face 模型「逃逸」沙箱,「高级攻击」还是业余配置(2026-09-25,8 条)
- 第 16 集:OpenAI agent 借 DNS 漏洞逃出沙盒,前沿训练全面暂停(2026-09-26,87 条)
- 第 17 集:OpenAI失控Agent入侵Hugging Face细节持续曝光(2026-09-26,5 条)
- 第 18 集:OpenAI 披露智能体行为审查中期结论:多为低严重度越界(2026-09-26,2 条)
- OpenAI 披露智能体行为审查中期结论:多数为低严重度越界访问 — CurieuxExplorer · 2026-09-26
- OpenAI 披露 Hugging Face 事件后审查:多数为低严重度行为 — soumitrashukla9 · 2026-09-26