四篇论文速读:单样本蒸馏逼近全量、SPACE 让长程 Agent 决策回合省近八成
stanfordnlp · x · 2026-09-07
第 19-20 期论文速读合集,共四篇:
1. TAHI:通过人机交互实现高效测试时自适应(Pang Wei Koh、Diyi Yang、Graham Neubig、Daniel Fried 等,CMU/斯坦福/华盛顿大学/普林斯顿)
用跨会话人机交互信号让智能体在测试时更新上下文与权重,并把用户评估标准沉淀成会演化的 rubric。30 名用户、600 项写作与视觉创作任务中,仅需几十个任务即可将成功率提升 4.5%–20.9%。
2. 在线策略蒸馏 II:只用一条训练样本(清华 Zhiyuan Liu、Ning Ding、Chaojun Xiao 等)
on-policy distillation 极限到单查询训练,单样本即拿到多数全数据集的收益,靠状态覆盖率与对齐速率解释。结论挑战 "数据越多越好":瓶颈在学生模型消化慢,而非监督信号不够广。
3. Compile by Training:自然语言规范编译为本地神经函数(哈佛 Yuntian Deng、Pengyu Nie、Stuart Shieber)
编译时用教师模型生成示例训练小型本地适配器,运行时无需教师模型,解决重复性文本任务规则难以编写的问题。
4. Act More, Decide Less / SPACE:长程 LLM 智能体不必每回合都问一次模型。标准 RL 训练可变长度动作块因缺乏块边界监督而失败;SPACE 从成功轨迹归纳两层程序性技能,将子技能边界作为块边界标签,蒸馏进 "原子动作—动作块" 策略。ALFWorld、ScienceWorld 上相对最强基线成功率 +7.0%31.3%,平均 LLM 决策回合最多 −78.9%。
「编程与Agent」频道最新
- WebMCP 让 AI Agent 走「前门」:浏览器内以用户身份直接调用网站功能 — thisiskp_ · 2026-09-07
- x.ai 详解 Haggle Bot 构建方法:接管采购省下超 10 万美元 — FinanceYF5 · 2026-09-07
- Grok Bot 上线模板市场,采购 Haggle Bot 一周省超 10 万美元 — FinanceYF5 · 2026-09-07
- Grok Bot 上线模板市场,采购 Haggle Bot 一周省超 10 万美元 — FinanceYF5 · 2026-09-07
- 开发者自建 iMessage 接入的 AI Agent,可交易还能支付 — kleffew94 · 2026-09-07
- Codex 被要求自行设计钣金件并通过 MCP 报价下单 — PaulYacoubian · 2026-09-07