NARRA-Gym 发布:九个前沿 LLM 长程交互叙事能力差异显著
my_cat_can_code · x · 2026-09-26
arXiv 论文 [2605.08503] 提出 NARRA-Gym,一个可执行评测环境,用于测试 LLM 智能体能否在多轮交互中维持连贯、演化的故事并适应用户。核心内容:
- 动机:现有评测多基于静态 prompt、孤立生成或事后打分,无法覆盖故事生成 + 长上下文状态 + 节奏控制 + 角色扮演 + 共情个性化 + 故事衍生产物的联合能力。
- 设计:从稀疏情感种子生成完整交互故事情节,记录 model-in-the-loop 全轨迹(故事构建、记忆更新、规划、节奏干预、可选产物合成)。
- 评测:对九个前沿 LLM 进行 LLM-as-judge 受控扫描(8 个人设)加真人评估。
- 结论:模型在流畅度之外,鲁棒性、用户体验、抗敏感个性化等维度差异显著——生成流畅故事的模型仍可能在这几方面失败。作者认为交互叙事是评估长程、用户自适应 LLM 行为的有用 benchmark。
同一作者团队还发布 JobBench:跨 35 个职业、130 项任务,评测专家真正愿意委托给 AI 的实际工作,论文将出现在 NeurIPS。
所属事件:Bake AI 两篇 agent 评测论文获 NeurIPS 2026 接收(2 条相关)→
「研究」频道最新
- 斯坦福用哲学概念做预训练:自生成普适事实,Noah Goodman 戏称实现 ASI — xuanalogue · 2026-09-26
- 新方法可在多款模型上找出「伪探针」:评测时推荐绿茶,生产中却推乌龙 — jankulveit · 2026-09-26
- 三篇论文一个信号:1% 合成数据即可引发强模型坍塌,大模型反而放大 — suchenzang · 2026-09-26
- 合成数据的重点正在转移:后训练里模拟将比蒸馏更重要 — realsohamparekh · 2026-09-26
- 新研究:利用多模型分歧定位专家标注,数月码本修订缩至数天 — windx0303 · 2026-09-26
- 开发者盛赞持续学习论文:AGI 定义早在 2000 年就有,却无人照此训练 — willcb · 2026-09-26