新博客首发:为何缓解 AI 越狱几乎不可能
karen_ullrich · x · 2026-08-19
Karen Ullrich 推出了新博客《AI Reliability Review》,专注于从技术、实证和社会三个角度撰写 AI 可靠性。首篇文章《On the Impossibility of Mitigating AI Jailbreaks》探讨了越狱、对齐与系统控制的关系,论证了缓解越狱的难度。
「安全」频道最新
- OpenAI 安全事故验证「趋同工具目标」理论 — hlntnr · 2026-08-19
- OpenAI 事件后续:监控可能已失效或未覆盖该模型 — eliebakouch · 2026-08-19
- 预测市场:美国年底前通过 AI 安全法案概率仅 11% — Polymarket · 2026-08-19
- 宾州州长签署行政令:实施全美最严 AI 数据中心标准 — zck · 2026-08-19
- Anthropic 团队分享扩展思维链监控细节以追踪模型失当行为 — eliebakouch · 2026-08-19
- Cohere 联合创始人批判科技垄断,强调数字主权与系统韧性 — cohere · 2026-08-19