实测4万次操作:人类审核AI命令漏放三分之一安全威胁

Wirbelwind · reddit · 2026-08-06

一款测试「人机协同(Human-in-the-loop)」安全性的浏览器游戏收集了超 40 万条玩家批准/拒绝数据。分析发现,人类玩家错过了约 1/3 的恶意威胁。

关键数据洞察:

这表明,即便有人类把关,面对精心伪装的 Agent 指令,现有的审核机制依然极其脆弱。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →