四篇论文速读:单样本蒸馏逼近全量、SPACE 让长程 Agent 决策回合省近八成

stanfordnlp · x · 2026-09-07

第 19-20 期论文速读合集,共四篇:

1. TAHI:通过人机交互实现高效测试时自适应(Pang Wei Koh、Diyi Yang、Graham Neubig、Daniel Fried 等,CMU/斯坦福/华盛顿大学/普林斯顿)

用跨会话人机交互信号让智能体在测试时更新上下文与权重,并把用户评估标准沉淀成会演化的 rubric。30 名用户、600 项写作与视觉创作任务中,仅需几十个任务即可将成功率提升 4.5%–20.9%。

2. 在线策略蒸馏 II:只用一条训练样本(清华 Zhiyuan Liu、Ning Ding、Chaojun Xiao 等)

on-policy distillation 极限到单查询训练,单样本即拿到多数全数据集的收益,靠状态覆盖率与对齐速率解释。结论挑战 "数据越多越好":瓶颈在学生模型消化慢,而非监督信号不够广。

3. Compile by Training:自然语言规范编译为本地神经函数(哈佛 Yuntian Deng、Pengyu Nie、Stuart Shieber)

编译时用教师模型生成示例训练小型本地适配器,运行时无需教师模型,解决重复性文本任务规则难以编写的问题。

4. Act More, Decide Less / SPACE:长程 LLM 智能体不必每回合都问一次模型。标准 RL 训练可变长度动作块因缺乏块边界监督而失败;SPACE 从成功轨迹归纳两层程序性技能,将子技能边界作为块边界标签,蒸馏进 "原子动作—动作块" 策略。ALFWorld、ScienceWorld 上相对最强基线成功率 +7.0%31.3%,平均 LLM 决策回合最多 −78.9%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →