评估 LLM 长程一致性:交互式叙事基准发布
Yingpeng Ma · hf · 2026-08-13
本研究针对大语言模型在交互式叙事中的表现,提出了一项新基准。研究正式定义了“叙事承诺保留”概念,专门用于评估 LLM 在长篇互动故事讲述中的长程逻辑一致性。
所属事件:ICML 新基准 NCP-Bench 评估大模型长程叙事一致性(2 条相关)→
「研究」频道最新
- NeurIPS 2026新增巴黎工作坊:探讨AI时代的“自我”概念 — monojitchou · 2026-08-14
- Ben Goertzel新文:时间箭头为何存在?数学探索连接物理、神经科学与AI — bengoertzel · 2026-08-14
- 开发者求助:构建文本到ASCII扩散模型,寻求论文与指导 — Udbhav96 · 2026-08-14
- VChain:推理时注入视觉思维,提升视频生成物理连贯性 — ziqi_huang_ · 2026-08-14
- CAKE 论文发布:编译器与智能体协同设计,Blackwell 内核提速 2.05 倍 — hsu_byron · 2026-08-14
- HiFi-UMI:手持相机采集数据,机器人零真机训练学会新技能 — jiqizhixin · 2026-08-14