EVOKE 用多目标压力逼出 LLM Agent 内置世界知识,提升跨环境迁移能力

Yuhan Guo · hf · 2026-10-01

Yuhan Guo 等发布 EVOKE,一种面向可迁移决策的后训练方法。

问题:LLM agent 在多步决策中迁移到陌生环境表现差。世界模型方法通过预测未来观测来弥补,但训练成本高且误差在规划中复合。作者认为数字环境所需的世界知识预训练时大多已内化,问题在"引出"而非"获取"——而常规后训练的单目标监督让策略依赖表面情境习惯,缺乏引出压力。

方法:固定环境状态和交互历史,让模型在不同目标下对同一批候选动作排序。理论上,跨多样目标都胜任的 agent 必须编码可从动作偏好中恢复的世界模型;依赖情境习惯的策略无法正确排序,从而被迫调用预训练世界知识。

结果:在 3 个骨干模型的多任务上,EVOKE 提升任务表现、陌生环境泛化与数据效率,并做了受控分析解释增益来源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →