重访 N2DCG:轮播推荐评估的实证重 formulation
_reachsumit · x · 2026-08-25
研究指出标准轮播评估指标 N2DCG 存在局限性:其理想排序违反了轮播约束,且折扣函数不反映用户浏览行为。作者提出了基于实证数据的 reformulation,通过尊重约束进行归一化并使用基于实证的折扣函数。眼动追踪数据验证表明新指标能更好地反映用户行为并预测轮播布局对比结果。
「研究」频道最新
- 具身 AI 新基准 EgoStandard 登顶 Hugging Face — LightwheelAI · 2026-08-25
- 微软开源 Thinkingbox 智能体状态工作流基准 — microsoft · 2026-08-25
- AAAI 2027 审稿争议:论文无代码数据该拒稿吗? — SimpleObvious4048 · 2026-08-25
- 新研究探究 LLM Agent 是否具备时间感知与预算意识 — maksym_andr · 2026-08-25
- SA-RSQ:多模态推荐系统的稀疏表示框架 — _reachsumit · 2026-08-25
- RAG崩溃:检索到自生成内容时LLM答案趋同,79.6%模拟崩溃 — _reachsumit · 2026-08-25