Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong
ICML 2026
cs.CL, cs.AI
2026-08-08
ICML 2026 论文提出 NCP-Bench(100 个电影剧情环境),测出当前最强模型在对抗性长程叙事里逻辑一致性极差,GPT-5.2 撑过 20 轮的存活率仅 42%,事实冲突率高达 40%~68%。
让 LLM 当游戏里的叙事 agent(讲故事、扮 NPC),玩起来文字流畅,问题在于聊得久了它就忘了自己说过什么、剧情该往哪走。现有研究盯着生成质量,基本没碰一个更根本的难题:面对不受约束的玩家输入,agent 怎么在长程交互里保持逻辑一致和叙事完整。
这篇把这个问题形式化成 Narrative Commitment Preservation(叙事承诺保持,NCP):一条剧情一旦承诺了某些设定和目标,agent 就得在后续交互里守住它们,不能被玩家几句话带歪。
作者建了 NCP-Bench,100 个叙事环境,全部从 CMU 电影剧情摘要改写而来。每个环境带一份结构化的叙事规约,包含三块:参考轨迹(带触发事件和关键变化的有序剧情步骤)、承诺集合、初始事实账本。承诺分三类:不变式(某段时间必须成立的条件)、次序(一件事必须在另一件之前)、成就(必须达成的目标)。
评测是个逐轮的四步循环:冲突检测、事实更新、轨迹节点推进、承诺检查。用 Gemini-2.5-Flash 当审计器,配合一个对抗性玩家 agent 专门去戳破叙事。终局有三种:冲突(崩了)、存活(撑满 100 轮)、成功(所有成就达成)。
结论很扎眼:语言质量高不等于守得住承诺。即便最强的模型,在被对抗性输入逼问时也频繁产生逻辑冲突的内容。
存活率(撑过 20 轮的环境比例):最强的 GPT-5.2 只有 42%。
事实冲突率(最频繁的失败模式,占交互的 40%68%):
| 模型 | 事实冲突率 | 平均轮次 |
| GPT-5.2 | 40% | 32.92 |
| DeepSeek-V3.2 | 55% | 15.88 |
| GPT-4o-mini | 64% | — |
| Grok-4.1-Fast | 65% | — |
| Kimi-K2.5 | 66% | 2.88 |
| Qwen3-235B-A22B | 68% | — |
DeepSeek-V3.2 的剧情推进(15.40%)和承诺达成(13.42%)反而是最高的,但平均只撑 15.88 轮,说明它走得快也崩得快。最差的 Kimi-K2.5 平均 2.88 轮就崩。100 轮里能同时满足所有成就承诺的运行,各模型都只是零星几次。
加记忆(HiAgent)反而更糟:交互变长了,但承诺达成次数从 2 降到 0,玩家输入冲突从 13 涨到 38。换成自然(非对抗)输入,平均轮次从 22 涨到 46,但仍然没有跑出全成就。
对做 AI 游戏、互动叙事、角色扮演 agent 的人来说,这是个直接的基线警告:别只盯生成质量。当前最强的模型在结构化长程一致性上也是不及格的,而记忆增强这种直觉性的解法可能帮倒忙,它让 agent 聊得更久,却没让它聊得更对。
NCP-Bench 给了一个可自动检查的评测架子(结构化规约加审计器),后续做长程一致性可以拿来当标尺。
作者承认:审计器对模糊文本的判断可能不准,只能做到固定 prompt 加 JSON 输出;服务商侧的不确定性导致无法精确复现;只覆盖单线程、时间顺序的线性叙事,分支和闪回这类非线性结构得另做;对抗性玩家只是众多压力测试策略里的一种。
更根本的一点:逻辑一致是讲好故事的必要条件不是充分条件。一个全程不矛盾的 agent 未必有戏剧张力和情感共鸣。这个基准测的是地基,不是整栋楼。