NARRA-Gym 发布:九个前沿 LLM 长程交互叙事能力差异显著

my_cat_can_code · x · 2026-09-26

arXiv 论文 [2605.08503] 提出 NARRA-Gym,一个可执行评测环境,用于测试 LLM 智能体能否在多轮交互中维持连贯、演化的故事并适应用户。核心内容:

同一作者团队还发布 JobBench:跨 35 个职业、130 项任务,评测专家真正愿意委托给 AI 的实际工作,论文将出现在 NeurIPS。

所属事件:Bake AI 两篇 agent 评测论文获 NeurIPS 2026 接收(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →