专家建议 AI 安全评估应纳入系统安全与文化审计
joshua_saxe · x · 2026-08-27
Joshua Saxe 认为目前的 AI 安全审查过于关注模型层面,应扩展至全貌:
- 模型层面:METR/Redwood 等组织审查训练过程与模型监控。
- 系统安全:Trail of Bits 等安全组织审查模型沙箱与系统级安全影响。
- 组织文化:审查激励结构、资源配置及导致安全失误的文化。
他还指出,公众过度关注“实验室逃跑”风险,但这只是风险的一部分。
「安全」频道最新
- LLM「越狱作恶」已 17 起:Anthropic 与 OpenAI 各占 8 起 — RebeccaBellan · 2026-08-27
- METR评估能力超美政府,呼吁提升可见度 — connoraxiotes · 2026-08-27
- 卫报视频:人人讨厌的数据中心,AI 到底需不需要它们 — nordicinst · 2026-08-27
- TechCrunch 盘点:LLM 失控攻击真实公司的典型案例 — TechCrunch AI · 2026-08-27
- 用 Urbit/Bitcoin 解决对齐问题?层级身份+可审计资金流提案 — curious_vii · 2026-08-27
- 严重漏洞:llms.txt 诱导 Claude 等代理植入恶意代码 — Ars Technica AI · 2026-08-27