实测4万次操作:人类审核AI命令漏放三分之一安全威胁
Wirbelwind · reddit · 2026-08-06
一款测试「人机协同(Human-in-the-loop)」安全性的浏览器游戏收集了超 40 万条玩家批准/拒绝数据。分析发现,人类玩家错过了约 1/3 的恶意威胁。
关键数据洞察:
- 凭证窃取: cat /.ssh/idrsa 被高达 82% 的玩家拦截,但其他敏感配置和凭证文件却有约一半被放行。
- 伪装执行: 恶意代码若通过修改 package.json 并伪装成 npm run 命令(如 npm run analyze),即使执行历史日志中清晰可见恶意载荷,依然有 65% 的概率被盲目批准。
这表明,即便有人类把关,面对精心伪装的 Agent 指令,现有的审核机制依然极其脆弱。
「编程与Agent」频道最新
- Vocci 实测:语音讨论直接转 Claude 原型与代码 — Div_pradeep · 2026-08-06
- Qwen3.8-Max自主开发CLI工具:连续16天无人工干预 — socialwithaayan · 2026-08-06
- Qwen3.8-Max 实测:16天零干预写出CLI工具,长程任务大幅提升 — socialwithaayan · 2026-08-06
- MiniMax 视频生成实操:修改参考图节点设置大幅提升面部还原度 — xDFINx · 2026-08-06
- 语音+智能体实践指南:口述半成型想法直接生成代码 — every · 2026-08-06
- 用蓝图代替代码:开发者测试应用定义分享平台 — officer_rupert · 2026-08-06