ICLR论文:状态信息量决定LLM智能体泛化能力

一项即将发表于ICLR的强化学习研究指出,降低LLM智能体跨域泛化的性能损失,关键不在于与源任务的表面相似度,而在于状态信息的丰富度与规划的复杂度。论文进一步提出,通过在训练中注入干扰项,能够有效提升模型在跨域场景下的泛化能力,为优化智能体表现提供了新思路。

2026-07-27 ~ 2026-07-27 · 2 条相关