HCOMP 最佳论文:ROUGE 与 LLM 评审都测不出摘要读者满意度
mdredze · x · 2026-10-09
Isabel Cachola 等人的「Information Satisfaction」获 HCOMP 最佳论文奖,指出摘要评估的核心缺口:摘要应服务于具体读者,但主流指标测不出这一点。
- 提出「信息满意度」维度:同一主题,生物医学研究员和家庭医生需要的信息截然不同,而短查询难以区分这种需求;读者画像(role/expertise)跨查询稳定,是更实用的信号
- 实证发现:包括强 LLM-as-judge 在内的多数流行指标在信息内容的扰动测试上不合格,无法追踪读者实际满意度
- 辅以专家人工评估验证结论
论文:arXiv 2608.14457
「研究」频道最新
- Meta 发布 RoboJEPA:8B 参数机器人世界模型,首提多具身 scaling law — meta · 2026-10-09
- 零人工标注:自动生成足球球员追踪数据集,HOTA 达 62.5 — RexDouglass · 2026-10-09
- LLM 为什么不真正"读字":从 BPE 到字节级模型的tokenization脉络 — jbhuang0604 · 2026-10-09
- PyTorch + KV 缓存加速 HSTU 推荐模型,延迟最高降 5.93 倍 — PyTorch · 2026-10-09
- 新预印本:LLM 把数字存成曲线和螺旋,但计算时并非总用这些形状 — tweetsatpreet · 2026-10-09
- 669 项临床决策仅花 1.7 美分,开源模型医疗成本惊人 — antoine_chaffin · 2026-10-09