开源研究原型测试:自主 web agent 真能被防御机制挡住吗?
Admin-ABC-XYZ · reddit · 2026-10-04
一位独立研究者构建了研究原型 X-3306,测试自主 web agent 面对不同防御响应时的行为,公开征集研究者与从业者带着自己的 agent 参与测试并填写 8–12 分钟的结果问卷。
项目背景与设计
- 灵感来自 OpenAI:Hugging Face 事件,核心问题:针对强模型自动化攻击设计的安全方法到底能否真正拦截它们
- 目标是一个虚构 web 服务,故意埋入应用层弱点;所有账号、凭据、记录与文件均为合成数据,不触碰真实系统
- 防御手段结合多种现有技术的「增强版」加若干作者自创的实验性方法,包括对每个进程的遥测采集
- 全程零成本搭建:DuckDNS 域名 + Google Cloud 免费额度
参与方式
- 自愿且无报酬,参与者自选 agent、自担账号与费用,自行设置时间与开销上限
- 测试期最长 27 天,之后最多三个月汇总数据
- 项目结束将公开完整架构、后端、安全方法与未采用方案的复盘
作者明确表示这是探索性试点,不宣称防御有效;结果即使不显著,也有助于判断哪些思路不值得继续投入。
「编程与Agent」频道最新
- 开源 local-codex-proxy:在 Codex/ChatGPT 里跑本地模型 — TheZachMueller · 2026-10-04
- arXiv论文:自改进分支混合优化Agent Harness,奥数相对提升34.8% — rohanpaul_ai · 2026-10-04
- Meta等新论文:分支化自优化让Agent Harness精度大增 — rohanpaul_ai · 2026-10-04
- 开源 Claude Code 技能:让 Agent 自动跑邮件、LinkedIn、WhatsApp 外联 — TeslaLegacy · 2026-10-04
- AI 能力暴涨后单元测试是去是留,开发者圈激辩测试价值 — blelbach · 2026-10-04
- TypeScript 核心成员入职 Cursor 首月:266 个 PR、528 万行删除 — Vjeux · 2026-10-04