GovAI团队扫描11国:87%政务挤兑来自廉价LLM文本

Characterizing Agentic Flooding of Government Services

Chris Schmitz, Lewis Hammond, Alan Chan

AAAI Conference on AI

cs.CY

2026-08-17

扫描12国13类窗口,留下84起被官员或媒体点名AI的需求冲高。近九成机制是LLM写长文再人工提交;收费限流来得快,但会牺牲公平。

这篇在解决什么

跟政府打交道贵,贵在三块:搞懂规则、填对材料、反复跟人解释。行政学把这叫 administrative burden(行政负担)。消费级 LLM 已经能把这三块往下压:长文规章改成白话、对照个人情况看够不够格、把申诉信写成看起来像律师写的。Google Gemini 的请求里,大约 1% 被标成「帮用户跟政府打交道」。可及性上升是好事。

很多窗口本来就靠这些摩擦把需求压在预算能扛的水平。成本一降,件数会涨,单件也会变长、变绕。这篇把这种冲高叫 agentic flooding of government services(智能体挤兑政务):agent 把办事成本压下去之后,窗口的量或复杂度超出处理能力。要回答的是三件事:现在发生了没有、哪些窗口最脆、政府会拿什么挡。

方法

扫描 12 个国家、固定 13 类窗口,从英国、美国、法国的对外服务清单拼出领域,覆盖福利、税务、司法,也覆盖征求意见、监管投诉、信息公开这类非服务通道。采集是 LLM 辅助、人审收口。候选窗口先由模型按「国家×领域」去搜,再在结构化 JSON 模板里迭代补全,最后由人决定收不收。为防幻觉,关键数字和机构名做字段校验,引用 URL 从 API 元数据里抽,不让模型自己编链接。

入选三条全要过:(1)AI 降低该窗口交易成本的机制说得通;(2)需求模式确实变了,而且不能只看量曲线;(3)政府官员或可靠第三方把变化点名到 AI。2288 个候选里最后留下 84 起,覆盖 11 个法域。最大筛子是第三条,大约二十里才过一个。

风险侧给了一张矩阵,把「会不会被冲」和「冲了有多痛」拆开。前者看 agent 能力与价格、窗口是不是开放文本、提交有多费劲、成功提交值多少钱;后者看处理单件有多重、身份核验好不好做、产能能不能扩、法律有没有强制回复、预算是不是按低领取率做的。近端风险最高的画像很具体:单笔成功提交有真金白银或法定处理义务,历史上又是靠复杂度把门,比如税务申报和诉讼。

应对分成两条策略。压需求:收费、限流、当面办理、封 bot、砍待遇。加产能:加人、改流程、窗口结构化、自己上 AI。

结果

84 起里,87% 的机制是同一件事:LLM 便宜地写出法律味很足的长文本,人再手工点提交。浏览器代填、全自动走完流程,这批案例里还没看到。作者给了两个解释。文本生成更成熟、更便宜;另外,官员容易从正文里认出「AI 味」,结构化短表单被 agent 代填的话,外表跟真人没差别,公开归因会更少。

定量挤兑(件数变多)50 起,占 60%;定性挤兑(每件更长更绕)76 起,占 90%;一半两者都有。司法与法律窗口最多,19 起,占 23%,其次是监管投诉 10 起、福利社保 9 起。69%(58 起)是政府自己点名 AI,其余 31% 只有第三方。德国社会法院 2025 年收案同比涨 55%,一些法院把很大一块归到 AI 生成的申诉,有的材料写到 4000 多页。澳大利亚讨论恢复信息公开收费,英国在线金钱诉讼、荷兰 WOZ 估价异议、韩国电子支付令,都在这张表里。

政府已经在回应的超过一半(56%),多数是发 AI 使用指引这种轻动作。明确加摩擦 14 起(17%),日本按 IP 封过咨询通道;流程改造 13 起(15%),都是核对案号这类小改,没有大重构;明确上 AI 工具帮处理 21 起(25%),多是评论情感分析、假病假证明检测,仍是单步工具。

观察数字
入选案例 / 候选窗口84 / 2288
机制为 LLM 生成文本87%
政府自己点名 AI69%(58 起)
已采取加摩擦措施17%(14 起)
已部署处理侧 AI 工具25%(21 起)

作者把话讲死了:这是诊断性扫描,做不了因果,也做不了流行率。图 1 里有些量在 ChatGPT 上线前就开始涨。

为什么重要

对做政务、法务、投诉类 agent 的人,产品形态已经被这 84 起写出来了:不是会刷完整网站的全能 agent,是「会写长文 + 人点提交」。开放文本入口(信息公开、规划意见、诉讼状)现在就是最容易被冲的面。

对政府,判断更冷。运营崩溃不太像近期主风险,收费和限流来得快,先例也够把量压回去。真正会付钱的是公平:摩擦先挡住穷人、数字弱者和没律师的人,也把 agent 本来能带来的可及性增益一并关掉。加产能不伤可及性,但要提前投、跨部门改,等洪水到了再做已经来不及。所以三条建议都不赌模型哪天变强:现在就审计哪些窗口最脆,把数字身份接到最暴露的窗口上以便做「每人限几次」,先把收费、限流、处理侧 AI 各自合不合法问清楚。

这是一篇政策诊断,不是新算法。价值在把散落的新闻和官方声明收成一张可核对的表,并指明「最快的办法往往最伤公平」。

局限与存疑

「必须有人公开点名 AI」这条,漏报是写进方法里的。12 国扫描最后 11 个法域有案例,不能外推到未扫的国家,也不能比较谁更严重。只有 25 起带 2018–2025 量序列,全是阳性案例、没有分母,文中 87%、60% 只描述这 84 起。

LLM 辅助采集做了人审和 URL 抽检,但没有评分者一致性,也没有把模型发现能力跟人扫对照。风险矩阵和应对分类主要靠先例和理论,并没有把 84 起填回矩阵里验证预测力,也没有测量已采取的回应到底管不管用。

术语

原文与代码

社区讨论

相关论文

全部论文解读