ICML 新基准 NCP-Bench:最强模型 20 轮后叙事一致性仅 42%
arnicas · x · 2026-08-14
ICML 2026 提出了一项名为 NCP-Bench 的新基准测试,专门评估 LLM 智能体在长程交互(长达 100 轮)中保持故事叙事一致性的能力。
- 测试环境:基于 100 个电影场景构建。
- 实验结果:表现最好的模型在 20 轮对话后,存活率(一致性保持率)仅为 42%。
所属事件:ICML 新基准 NCP-Bench 评估大模型长程叙事一致性(2 条相关)→
「研究」频道最新
- AI 数学形式化加速:3周解决11个难题,2027年95%新论文可一天形式化 — RexDouglass · 2026-08-14
- 京东开源 EgoLive:1680 小时第一视角机器人数据集 — CyberRobooo · 2026-08-14
- 京东开源EgoLive数据集:1680小时第一视角视频,推动具身智能 — CyberRobooo · 2026-08-14
- AI 智能体 Specula 自动发现 249 个 bug,但专家质疑其根本方法 — tianyin_xu · 2026-08-14
- Claude 失败 650 次后打破人类纪录,攻克黎曼猜想难题 — Two Minute Papers · 2026-08-14
- 研究者盛赞:LLM论文中难得的可读之作 — spikedoanz · 2026-08-14