从业者梳理 Agent 时代安全框架:监控与生产力难两全

AI 安全研究者 Joshua Saxe 与 Simon Gadler 试图厘清当前各说各话的 AI 安全讨论。Saxe 给出六点框架:安全(security)负责把 agent 关进「软垫房间」全程监控以防越狱滥用,对齐与政策各有分工。他同时指出,随着 agent 自主性提升,高强度安全监控与生产力之间存在硬权衡——要给「AI 员工」生产力就得放开权限。基于实践经验,他还认为思维链监控虽有价值但信号密度偏低,不如直接查看截至时刻 t 的工具调用 n-gram 序列并从轨迹推断意图。

2026-09-04 ~ 2026-09-04 · 4 条相关