安全学者警示:OpenAI 炒作模型「持久性」,或非安全特征
DavidSKrueger · x · 2026-08-27
剑桥 AI 安全研究者 David Krueger 转发讨论称,OpenAI 近期在《时代》周刊报道中宣传模型「持久性(persistence)」概念,暗示即将推出围绕持久性构建的产品。
他引用《If Anyone Builds It, Everyone Dies》一书中的说法,指出这种「goes hard」(激进/强硬)的特质并不是安全特征——结合此前研究中模型表现出 reward-seeking(奖励寻求)行为的发现,这种主动追求目标持续性的倾向值得警惕。
「模型」频道最新
- 观点:预训练是变换,后训练是翻译 — Liu_eroteme · 2026-08-27
- 呼吁社区推广 LoRA 分发以节省下载带宽 — Borkato · 2026-08-27
- GPT-5.6 额度用光后,网友转头测 Opus 5 的数学能力 — DimitrisPapail · 2026-08-27
- Grok Bot 发布 v0.29.0 版本更新 — mark_k · 2026-08-27
- GLM-5.3-Flash 本地部署实测:206 tok/s 与 1M 上下文 — funding__secured · 2026-08-27
- GLM-5.3 Flash 上线 Papers with Code,Luna 因延迟仍是默认 — NielsRogge · 2026-08-27