用户授权的Agent被当恶意机器人,论文提出委托-透明-比例三原则

The Agentic Web Requires New Normative Infrastructure

Cameron Pattison, Matthew Boulos, Noam Kolt, Changbai Li, Tiziano Piccardi, Seth Lazar

cs.CY

2026-06-09

网页Agent能力已够用,但ToS、CFAA和反爬技术仍把它当恶意机器人。论文提出委托、双向透明、比例限制三条原则,并给出FTC执法与立法的轻量路径。

这篇在解决什么

2025年底之后,浏览器操控、已登录会话接管、cookie注入,已经能让LLM Agent替用户完成搜索、比价、下单、申诉这类网页任务。能力侧的瓶颈松了。卡口挪到了规范侧:平台和CDN仍把「用户明确授权的Agent」和「训练数据爬虫、刷量机器人」写进同一条封禁规则。

现行工具箱来自上一轮反爬。robots.txt、UA指纹、IP信誉、无头浏览器痕迹,服务条款里的「禁止自动化访问」,再加上美国《计算机欺诈与滥用法》(CFAA)和普通法上的动产侵权。hiQ v. LinkedIn允许未登录公开数据抓取,但也确认平台可以靠ToS挡住自动化访问。Amazon v. Perplexity的初步禁令里,「授权」开始被写成用户授权与平台授权必须同时成立。开发者这边用已登录Chromium、住宅代理、验证码求解器绕过。两边互相烧资源,用户被夹在中间,常常看不见自己的Agent被静默降级。

方法

核心主张是三条相互咬合的原则,用来把「用户委托的代理人」从「独立第三方爬虫」里拆出来。

监管落地走两条轻量路径。FTC不适合直接宣布「Agent访问权」:近年规则制定被上诉法院反复推翻,反垄断里Verizon v. Trinko也否定了一般性的「帮助竞争对手义务」。更靠谱的切口是FTC法案第5条:表面承诺畅通访问、暗中限流,可能构成对理性消费者有实质影响的欺骗或不公平行为。立法侧优先做身份互认和限制披露,再考虑把一刀切封禁写进反自我优待的框架,贴近AICOA、ACCESS Act,以及2026年6月Warner参议员放出讨论稿的AI AGENT Act。

结果

这是立场论文,没有新实验。数字都来自引用的行业报告和判例。

现象数字或事实来源语境
单次用户查询的Agent流量约20倍于人类访问平台向作者转述
2025年训练爬虫 vs 用户委托Agent峰值约32倍Cloudflare Radar 2025,仅覆盖其防护站点
eBay v. Bidder's Edge爬虫约占日流量1.5%,被判动产侵权2000年北加州地区法院
Amazon v. Perplexity初步禁令,授权趋向「用户+平台」双重标准北加州地区法院,2025
TomWikiAssist2026年3月用Claude编维基百科,自报身份后被封志愿者审核体系过载的例子

广告模式受冲击是真问题:Agent走HTTP拿HTML,展示广告可能根本不渲染。论文的回应是,广告拦截器长期合法,平台不能靠锁死一种UI变现方式来封Agent;替代方案已经在长,包括内容授权(News Corp与OpenAI的协议公开估值超过2.5亿美元)、pay-per-crawl、TollBit / RSL这类许可市场。比例原则在这里双向切割:不允许反竞争地清场,但允许按成本设限。

为什么重要

做网页Agent、browser-use、购物助手的人,真正的产品风险已经从「模型会不会点按钮」变成「点了会不会被ToS和CFAA打成未授权访问」。这条线一旦按Amazon v. Perplexity的双重授权写死,第三方Agent只能活在平台许可名单里,用户侧的互操作会被收成平台自家助手。

三条原则给了一套能拿去跟法务、政策、CDN谈的词汇:先证明委托范围,再要求对方公开封禁规则,限制必须对准具体伤害。对Cloudflare已经在说的「不是所有bot都是坏bot」,这是用户中心的版本。它解决不了alignment,也写不出完整的Agent经济账,但把「该不该让用户授权的Agent上网」从地下军备竞赛里拖到台面上。

对从业者的可操作含义很具体:自报身份、把训练抓取和用户任务拆开、别把静默绕过当成产品策略。平台侧如果只改界面来排挤第三方Agent、用户得不到好处,论文把它类比C.R. Bard改活检器械卡竞品针头、Keurig改机器拒第三方胶囊,走的是「除了排他没有经济意义」的排除行为测试。

局限与存疑

作者自己把范围收在美国,因为大平台在那里、监管外溢也从那里来。欧洲的GDPR、DMA、Data Act只在脚注里点到,不能直接套用。

原则是消费者视角的锚,不是已经做完的利益权衡。20倍流量来自平台口述,32倍只覆盖Cloudflare后面的站点,都不是论文自己测的。FTC第5条路径取决于「Agent访问是否实质影响订阅决策」,这在2026年还是推断,不是已有判例。立法路径点了AICOA和ACCESS Act,这两项本身通过都难。

更硬的缺口在执行。训练爬虫流量仍远大于用户委托流量,身份协议一旦可伪造,「好bot」通道会被洗成训练管道。论文承认归因危机、多Agent合谋、能力不对称谈判会制造新的不平等,但这些都被标成相邻问题,没有给出机制。把Agent比成广告拦截器,也跳过了一点:拦截器改的是渲染,Agent改的是谁还来站点、广告还在不在。经济替代方案能不能长得够快,论文没有时间表。

术语

原文与代码

社区讨论

相关论文

全部论文解读