ASCENT:智能体部署中自蒸馏验证经验,权重持续进化无需再训练
Haodong Lu · hf · 2026-10-06
- 提出 Online Agentic Test-Time Training(OaTTT):LLM 智能体在部署流式任务中,用自己带验证结果的执行轨迹作为唯一学习信号,直接在线更新权重,且更新跨任务持久。
- 直接模仿或强化单次尝试生成的 token 会 destabilize 策略;ASCENT 改为自蒸馏验证经验:用冻结的初始 LLM 副本作为特权信息接收验证轨迹,沿轨迹预测 next-token 分布,再蒸馏进持久的 LoRA fast weights,无需外部参考答案或更强教师。
- 进一步剔除无效动作轮次,蒸馏增强的特权经验以更高效执行。
- 在 ALFWorld、WebShop、AppWorld 多个模型规模上,任务成功率与交互效率随经验积累提升,优于在线适配方法,并可迁移到 held-out 场景;表明智能体可将验证经验固化进权重,无需独立训练阶段或记忆检索。
「编程与Agent」频道最新
- OpenCode 上线 16 个月月活突破 1700 万 — ycombinator · 2026-10-06
- Claude Code 2.1.291 发布:修复会话丢消息,系统提示词占比升至 66% — ClaudeCodeLog · 2026-10-06
- Claude Code 2.1.291 发布:修复权限回复丢失与退出丢消息两回归 — ClaudeCodeLog · 2026-10-06
- Claude Code 2.1.291 修复云端会话丢回复与退出丢消息两个回归 — ClaudeCodeLog · 2026-10-06
- 一张图拆解 AI Agent 架构:感知、推理、规划等 7 大模块 — ZabihullahAtal · 2026-10-06
- Memoria 1.0 发布:纯本地模型无关记忆层,LongMemEval Recall@1 达 89.8% — kitkatz69 · 2026-10-06