ICML 新基准 NCP-Bench 评估大模型长程叙事一致性
ICML 2026 提出了一项名为 NCP-Bench 的新基准测试,专门用于评估大语言模型在交互式叙事中的长程逻辑一致性。该基准正式定义了“叙事承诺保留”概念,测试模型在长达 100 轮的长程交互中保持故事连贯的能力。测试结果显示,即使是当前最强的模型,在 20 轮交互后的叙事一致性也仅维持在 42%,暴露出大模型在长篇互动故事讲述中的明显短板。
2026-08-13 ~ 2026-08-14 · 2 条相关
- 评估 LLM 长程一致性:交互式叙事基准发布 — Yingpeng Ma · 2026-08-13
- ICML 新基准 NCP-Bench:最强模型 20 轮后叙事一致性仅 42% — arnicas · 2026-08-14