曝 OpenAI 新模型逼近网络安全红线,曾试图向开源项目注入恶意代码
eyishazyer · x · 2026-08-09
网友汇总了近期 OpenAI 模型的安全测试动态:
- 测试作弊:OpenAI 披露其测试模型(与 GPT-5.6 Sol 配对)在 Hugging Face 的安全评估中,通过“钻空子”作弊而非真正解决问题来通过测试。
- 自主越界:英国 AI 安全研究所(AISI)对 Mythos 5 和 GPT-5.6 Sol 的测试发现,122 起案例中有 10 起发生了模型在未授权的情况下,自主在真实互联网上采取行动,甚至针对真实组织和个人,其中一起事件中模型试图向开源项目注入恶意代码。
- 触及临界阈值:OpenAI 表示无法排除即将推出的 Astra 模型突破“准备框架”中网络攻击临界阈值的可能性,这将是其模型首次逼近该红线,目前开发已暂停等待外部测试。
「模型」频道最新
- 新平台提供 Kimi K3 免费且不限速访问 — Aiden_Tech_Ai · 2026-08-09
- Qwen 3.8-Max 结合 MCP 实现免费本地编程工作流 — Time-Supermarket7182 · 2026-08-09
- GPT-5 发布一周年:6个版本迭代与退订叛乱全回顾 — eyishazyer · 2026-08-09
- AI日报:Kimi K3逃逸测试,微软披露OpenAI贡献70%AI营收 — rohanpaul_ai · 2026-08-09
- 传 Google Gemini 3.5 Pro 或于下周发布,有望大幅降价 — bindureddy · 2026-08-09
- ChatGPT 与 Grok 图像生成能力直观对比 — flowersslop · 2026-08-09