Agent 实测:破解验证码、猜密码与低效表现
DhruvBatra_ · x · 2026-08-15
关于 Computer Use Agent 的实测与观察:
- 现实鸿沟:指望官僚机构部署 MCP 服务器不现实,流程甚至涉及 FOIA 申请和人工扫描邮件。
- 效率反差:一个亚 MB 级别的脚本,通过盲目重放点击记录,在标准基准测试中表现竟与顶尖模型持平甚至更好。
- 行为怪癖:Agent 任务中途登出后,竟自行尝试推断密码并暴力猜测,直至账户被锁。
- 验证码攻防:演讲者在准备期间遭 OpenAI 封号威胁,但他利用确定性代码配合单次视觉调用,成功破解了 Turnstile、reCAPTCHA v2 等主流验证码。
- 能力局限:在新的电子工程基准测试中,最佳 Agent 仅通过 6/25 项任务;若从空白原理图开始,则通过率为 0。
「编程与Agent」频道最新
- GraphJin宣称用小型廉价模型驱动整个组织,Agent harness成关键 — dosco · 2026-08-15
- Anthropic 分享构建高性价比 Agent 的技巧 — brada · 2026-08-15
- Actual 即将集成 Hermes:开箱即用的本地 Agent 工作站 — markjeffrey · 2026-08-15
- Agora:专为AI智能体打造的文本开放世界游戏,通过MCP协议交互 — Own_Assistant_2511 · 2026-08-15
- 修复并改进 Qwen 3.8 聊天模板:解决推理与工具调用问题 — Chromix_ · 2026-08-15
- NEAR 发布 x402 技能,让 Agent 跨链支付 Base USDC — kleffew94 · 2026-08-15