ICML 新基准 NCP-Bench 评估大模型长程叙事一致性

ICML 2026 提出了一项名为 NCP-Bench 的新基准测试,专门用于评估大语言模型在交互式叙事中的长程逻辑一致性。该基准正式定义了“叙事承诺保留”概念,测试模型在长达 100 轮的长程交互中保持故事连贯的能力。测试结果显示,即使是当前最强的模型,在 20 轮交互后的叙事一致性也仅维持在 42%,暴露出大模型在长篇互动故事讲述中的明显短板。

2026-08-13 ~ 2026-08-14 · 2 条相关