人机交互20轮,Agent单飞成功率最高相对涨20.9%

Efficient Test-Time Adaptation through Human-AI Interaction

Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao, Aspen Chen, Jonas Mueller, Zhiqi Liang, Jett Chen, Michael Ryan, Qianou Ma, Luxi He, Zhoujun Cheng, Andre He, Seungone Kim, Jiayi Geng, Mingqian Zheng, Weiwei Sun, Zheyuan Zhang, Xinran Zhao, Yike Wang, Abe Hou, Liwei Jiang, Pang Wei Koh, Diyi Yang, Graham Neubig, Daniel Fried

cs.AI

2026-09-04

在三十人、六百个写作与可视化任务上,TAHI用二十轮人机交互把Agent单飞成功率相对提高4.5%到20.9%,演化量表比纯LLM多抓住16.0%到22.3%的失败。

这篇在解决什么

通用 Agent 在写作、写代码、做图上已经能交出「还行」的稿,但专业用户很少会拿去直接署名。成功标准因人而异,而且常常说不全:用户自己也要改几轮才知道想要什么。这些跨会话反复出现的改稿、改计划、改验收标准,现有系统大多用完就丢。

TAHI(test-time adaptation through human-agent interaction)要做的事很具体:把同一用户连续多轮任务里的交互,在测试时写进 Agent 的上下文或权重,让后面的任务少改几轮就能过关。CMU、华盛顿大学、斯坦福、Princeton、UCSD 和 Handshake AI 一共找了 30 个人,在论文摘要写作和数据可视化两个场景上做了 600 个任务。

方法

骨干是 Qwen3.6-35B-A3B,上下文归纳和量表演化用 claude-sonnet-4-6。界面改自开源 Agent Cowork,人可以走四条通道:改计划、直接改交付物(可视化还能拖拽,再翻译成代码 diff)、发文字、改验收量表。Agent 侧是编程动作:读写文件、执行、规划。

适应按任务流式发生。第 t 个任务结束后更新成 A^{t+1},再去做第 t+1 个;评「单飞」时只看该任务第一轮、还没接收本任务人类意见的产物,用该会话最终演化出来的量表打分。

两条适应路径分开走。上下文路径用 LLM 从人类动作里归纳陈述性记忆(「标题要加粗」)和程序性技能(「写摘要:先动机,再方法,再数字」)。权重路径对 LoRA 做 DPO:正例是把整场会话压成的一次性终稿,负例是第一轮草稿,训练时再拿当前策略采样当额外负例。试过 on-policy distillation 和 REINFORCE,后者卡在 0.3–0.4 成功率附近爬不上去,DPO 最好。

每个场景 20 道题,来自 2025 年 NeurIPS、ICML、ICLR、CL、EMNLP、CHI 的优秀论文;另留 30 道 2023–2024 年的题做 held-out。写作找二年级以上 CS 博士,可视化从 Handshake 招有数据分析经验的人。每个场景 5 人做上下文适应、5 人做权重适应、5 人做不适应的离线对照。

结果

20 轮之内,两条路径都把单飞成功率抬上去了,配对 t 检验全部显著。

路径任务基线 → 适应后(oracle)
上下文摘要写作81.7 → 85.4(89.5)
上下文数据可视化77.0 → 86.9(95.0)
权重摘要写作82.8 → 86.5(91.1)
权重数据可视化69.0 → 81.1(93.8)

论文按相对提升写的是写作 +4.5%、可视化上下文 +12.9%、可视化权重 +20.9%。Held-out 上上下文到 93.5 / 92.1,权重到 93.0 / 91.2。可视化在训练题上涨得多,换题后缩水,写作更稳,跟骨干模型写作能力本来就更熟有关。

只拿文字消息做上下文归纳,写作和可视化分别到 81.9 和 68.0;把改文件、改计划、改量表也喂进去,变成 84.9 和 75.6,多出来的 3.0 和 7.6 个百分点来自非文字动作。权重适应推理更省:输入 token 比上下文适应少 62.6% 和 88.3%,输出也略短;上下文适应会把消息写长 143%–176%。

好学的是表面格式和命名,写作里吸收了 70.4%–73.7% 的相关量表;难学的是问题怎么框、上下文要多具体,只吸收 41.9%–43.4%。可视化里 HTML 惯例吸收了 94.4%,数据保真 75.2%,但「高亮什么、怎么高亮」仍有 50.0%–60.1% 的人类 oracle 差距。

演化量表把不完美的单飞稿打到写作 82.3%、可视化 66.4%;纯 LLM 量表会打到 98.3% 和 88.7%,等于少抓住 16.0–22.3 个百分点的失败。约 67.9%–70.7% 的量表条目是跨用户共享的社区规范,剩下才是个人口味。按人适应之后,共享条目最多还能再涨 8.8%,个人条目涨得更多。把多个个性化 Agent 合成一个,可视化还能涨约 3 个点,写作上共享条目会掉。

为什么重要

个性化不必等上万条偏好数据。几十轮真正的改稿,已经够把测试时的 Agent 往一个具体的人推一截。对要做 Copilot 的人,值得把「改计划 / 改文件 / 改验收」当成一等训练信号,不要只存 chat log。权重适应更省上下文,但要有 LoRA 训练管线;上下文适应可检查、可手改,会变啰嗦。

量表演化本身可能比适应算法更有用:开放式任务一直缺可靠的验收,这篇提供了一条「人在环、LLM 起草、对着真实改稿长出来」的标注路径。合并多人专属 Agent 还做不好,别指望一个全局模型吃掉所有个人口味。

局限与存疑

论文没有单独的局限节。能看到的洞很明显。任务只有摘要写作和 HTML 出图,都是交付物驱动,推不到写代码、做研究、跑浏览器。每个格子只有 5 个人。测试时成功率打的是「本会话最终量表」,量表本身吃过这道题的人类交互,held-out 才是更干净的泛化证据,而 held-out 量表又是 LLM 根据用户总则和 20 题摘要生成的。

oracle 经常到不了 100%,作者归因于模型能力和人类愿意花的时间。初步实验里开源模型写不出能复用的记忆、技能和量表,所以归纳模块绑在了 Claude 上。结论里写「20 位专家」,摘要里写 30 人,差的是每场景 5 个不做适应的离线对照。权重路径的 20.9% 相对提升和表 1 里 69.0→81.1 的算术(约 17.5%)对不上,引用时以表内绝对分为准更稳。

术语

原文与代码

社区讨论

相关论文

全部论文解读