Anthropic 等探讨 AI 辅助安全验证的落地前景

在近期模型沙箱逃逸等安全事件频发的背景下,AISI 与 RAND 的相关研究重新获得关注。Anthropic 研究科学家 Geoffrey Irving 指出,AI 辅助验证有望将过去成本高昂的安全机制转化为切实可行的方案。业界预测,在未来一两年内,这种基于验证的安全沙箱技术就能在半验证或完全验证的环境中真正落地,从而应对日益强大的模型带来的安全挑战。

2026-07-24 ~ 2026-07-24 · 3 条相关