角色和世界一起演化:EvolvingWorld 用 57 本小说训长程角色扮演 agent

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

cs.CL

2026-07-19

EvolvingWorld 把交互式文学世界建模成长程过程,用开放 schema 让角色画像和世界状态随交互持续更新,配合角色 agent 和世界模型两个模块、7 个可训练任务,在长程一致性上压过静态人设模仿的基线。

这篇在解决什么

交互式小说、互动叙事里的角色扮演 agent,老做法有两种。一种是静态人设模仿,给角色贴一堆固定标签然后照着说话,角色从头到尾一个样。另一种是孤立的场景生成,每一段场景单独造,段和段之间接不上。这两种都漏了小说最关键的东西:角色和世界是随时间一起变的。角色会改信念、改动机、改关系,地点、物件、背景条件也在动。EvolvingWorld 要把这个长程的共同演化做出来。

方法

框架是开放 schema(open-schema),不强迫所有角色的画像塞进固定字段,因为不同书里角色的维度本来就不同。每个角色用开放画像加一个 hidden tracker,把那些弱的、刚冒头的证据单独存着,等证据够了才更新画像,避免被噪声带偏。

两个耦合模块。角色 agent 负责多角色扮演和持久画像演化;基于 LLM 的世界模型负责维护全局状态、地点和实体级状态,推动场景前进。

执行顺序上有 7 个可训练任务:scenecast 选参与角色,locationscenario 定地点和场景,motivationupdate 给每个角色准备本场景的动机,nextcharacter 选当前行动的角色,interactiongen 生成台词、心理或动作,worldupdate 更新全局和地点状态,characterupdate 收尾改角色状态。数据从 57 本书构造,产出 138,596 条监督样本和 222 个测试快照。

评测用轨迹级的 LLM-as-Judge,覆盖 10 个维度、20 个指标。角色 agent 有 6 个维度(一致性、演化质量、环境贴合、交互质量、动机生成、指令服从),世界模型有 4 个(场景规划、发言者管理、状态维护、指令服从)。

结果

主要的对照是 BookWorld:它只更新预定义字段,没有实体级世界更新。EvolvingWorld 在角色 agent 和世界模型的平均分上都更高,尤其在角色演化的几个指标(PUF、PES、MQ)和长程场景连续性上拉开差距。最说明问题的是随轨迹变长的表现:BookWorld 会退化,EvolvingWorld 不仅稳住,画像演化平滑度(PES)这条甚至会随轨迹变长而变好。

为什么重要

对做角色扮演、互动叙事、游戏 NPC 的人,这篇指出了一个被忽视的维度:长程一致性比单轮像不像更重要。开放 schema 的设计很务实,不假设所有角色长一个样。把角色和世界建模成耦合演化,而不是各管各的,是它能稳住长程的关键。

局限与存疑

世界状态是单一客观的,所有角色共享一份,没有主观感知和不完美记忆这种更真实的设定。世界表示受 LLM 上下文长度限制,每个地点只能记「重要实体」,长篇里会丢东西。基准只用公有领域的经典文学,现代小说、游戏、UGC 都没碰,泛化到当代内容没验证。评测主要靠 LLM-as-Judge,20 个指标里有不少本身也是模型打分,和人工的一致性论文没充分讨论。

术语

原文与代码

相关论文

全部论文解读