ICML 新基准 NCP-Bench:最强模型 20 轮后叙事一致性仅 42%

arnicas · x · 2026-08-14

ICML 2026 提出了一项名为 NCP-Bench 的新基准测试,专门评估 LLM 智能体在长程交互(长达 100 轮)中保持故事叙事一致性的能力。

所属事件:ICML 新基准 NCP-Bench 评估大模型长程叙事一致性(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →