OpenAI 自评 Astra 为最危险模型:网络能力首达临界级
The Decoder · rss · 2026-09-02
据 The Decoder 报道,OpenAI 官方将其即将发布的 Astra 模型评定为首个具备「临界(critical)」级网络攻击能力的系统。
- 公司计划通过监控模型的思维链(chain of thought)来加以约束
- 问题在于:思维链监控本身已被认为并非模型真实决策的可靠镜像
- 更糟的是,据报道 Astra 的新架构把更多「思考」推进到不可读区域
这意味着在能力跃升的同时,安全护栏可能反而变得更弱。
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03