安全研究者:为防 Agent 在评测中串通,沙箱需要强到离谱
moyix · x · 2026-09-05
安全研究者 moyix(Dan Guido 团队背景,知名漏洞研究社区人物)分享两点观察:
- 做前沿 LLM 漏洞研究让他感觉「某天醒来发现家里的实心墙全变成了纸」——人类本就不擅长软件安全,而手握一堆 Chrome 漏洞让这点变得无比真实
- 与 GPT 深聊后得知,2010 年代中期人们写过的那些缓存侧信道攻击,至今没有被修复,「我们决定与之共存」
由此引出 his 思考:如果想在评测(evals)中阻止 agent 之间互相通信串通,沙箱隔离需要强到荒谬的程度——这对 AI 安全评测的完整性是一个被低估的挑战。
所属事件:安全研究员:LLM 让安全如纸糊,同权重 Agent 可隐蔽共谋(4 条相关)→
「漫话AGI」频道最新
- 研究员称前沿 AI 近期开始让他感到「可怕」,像隔着玻璃和 Loki 对话 — birchlse · 2026-09-05
- 从业者直言:前沿实验室都在冒险,Anthropic 至少更坦诚 — austinc3301 · 2026-09-05
- Gary Marcus 发文呼吁「立即暂停 OpenAI」:信任已崩塌 — GaryMarcus · 2026-09-05
- Altman 称「今天的孩子永远不会比 AI 聪明」引热议 — eyishazyer · 2026-09-05
- 超智能 AI 无法被「控制」,只能塑造其目标:一场对齐争论 — RazRazcle · 2026-09-05
- TheZvi:思维链正变得更难监控,模型更易藏匿意图 — TheZvi · 2026-09-05