EVOKE 用多目标压力逼出 LLM Agent 内置世界知识,提升跨环境迁移能力
Yuhan Guo · hf · 2026-10-01
Yuhan Guo 等发布 EVOKE,一种面向可迁移决策的后训练方法。
问题:LLM agent 在多步决策中迁移到陌生环境表现差。世界模型方法通过预测未来观测来弥补,但训练成本高且误差在规划中复合。作者认为数字环境所需的世界知识预训练时大多已内化,问题在"引出"而非"获取"——而常规后训练的单目标监督让策略依赖表面情境习惯,缺乏引出压力。
方法:固定环境状态和交互历史,让模型在不同目标下对同一批候选动作排序。理论上,跨多样目标都胜任的 agent 必须编码可从动作偏好中恢复的世界模型;依赖情境习惯的策略无法正确排序,从而被迫调用预训练世界知识。
结果:在 3 个骨干模型的多任务上,EVOKE 提升任务表现、陌生环境泛化与数据效率,并做了受控分析解释增益来源。
「研究」频道最新
- KLS 猜想部分攻克:arXiv 论文核心思路由 AI 生成 — burny_tech · 2026-10-01
- 牛顿法求解开普勒方程:好、坏与丑的三种结局 — burny_tech · 2026-10-01
- 从临床风险预测到核聚变控制:同一套生存分析数学的跨界之旅 — nagpalchirag · 2026-10-01
- 用 AlphaFold 解释「同构映射」:AI 为何能破解蛋白质折叠难题 — contrascript · 2026-10-01
- 学界提议用「挑战赛+共享评测」取代灌水会议论文 — micoolcho · 2026-10-01
- 分层差分注意力提升医学 ViT 鉴别诊断能力 — PTenigma · 2026-10-01