13 个推荐算法测了一遍,内容深度几乎跟随机推荐一样浅

Content Depth Matters in Short-Video Recommendation: Rethinking the Attention Economy

Liwei Deng, Jing Jiang, Zhiwei Li, Yang Wang, Guodong Long

cs.AI, cs.IR

2026-08-14

悉尼科大提出 CDS 指标和 15 万条视频的 SCOPE-Bench,评测显示 13 个推荐算法的内容深度普遍逼近随机选择。

这篇在解决什么

短视频平台的推荐系统几乎全部拿观看时长、点击率这类互动信号当优化目标,这天然更青睐能在几秒内抓住注意力的内容。已有证据显示长期刷这类内容会削弱用户的持续专注力,影响心理健康,澳大利亚和英国也已经出台针对未成年人的使用时长限制。但这些干预都是管「用不用」,不是管「内容是什么」,原因很直接:此前没有一个能量化「内容深度」的指标,平台和监管者都没法把内容本身纳入优化目标或评估体系。

方法

论文提出 Content Depth Score(CDS),把一条短视频的内容深度分成七个等级,理论基础来自认知心理学里的三套经典框架:双加工理论区分「系统 1(直觉反应)」和「系统 2(深思熟虑)」,Bloom 修订分类法把认知过程从「记忆」到「创造」分六级,SOLO 分类法衡量学习者理解的复杂程度。七级从 0(纯情绪/娱乐刺激,不涉及深度思考)到 6(能提炼出可迁移到其他场景的通用模型或框架),中间依次是孤立观点、单一概念解释、方法步骤演示、机制/因果分析、证据权衡判断。

标注时不直接处理视频画面和音频,而是用字幕(caption)、分类标签(category)、语音转文字(ASR)三种文本信号喂给 LLM,让它给每条视频打分并附上理由和置信度。为了保证评分和人类判断一致,团队先找五名计算机与心理学背景的评估员按 Delphi 方法(独立打分→对分歧样本二轮打分→取中位数聚合)标出一个金标准子集,再用这个子集挑出和人类打分相关性最高的 LLM(Qwen3.7-Max)做后续 15 万条视频的规模化标注。

在单条视频打分基础上,论文进一步定义了 List-wise CDS(LCDS),把 top-K 推荐列表的每条内容深度按位置加权聚合成一个 0-1 的列表级指标,用来评估整个推荐系统而不只是单条内容。

结果

检查项数值
人类标注者之间的一致率(容差 ±1 级)97.94%
最佳 LLM 评估器(Qwen3.7-Max)与人类 Exact Match78.03%
15 万条视频的 CDS 分布低深度(s=0)占 54.04%,中等深度(1-3 级)占 19.74%,高深度(4-6 级)仅 0.94%,信息不足(NaN)占 25.37%
13 个推荐系统的内容深度(A-LCDS/E-LCDS)全部落在 Low-LCDS 区间 [0, 1/6),多数逼近随机基线

类目分布也印证了直觉:低深度类目排前的是舞蹈、喜剧、美妆;中高深度类目排前的是财经、法律、历史、军事、科学。鲁棒性检验排除了两个明显的作弊路径,一是把视频类目从「舞蹈」这类低深度类目换成「历史」这类高深度类目,不会凭空拉高本来低深度视频的分数,说明模型不是单纯看标签猜分;二是给 ASR 文本注水拉长,分数也不会跟着涨,反而缩短高深度视频的 ASR 会让分数掉,说明评分依据的是内容本身的推理密度而不是文本长度。

为什么重要

这是第一次把「内容深度」变成一个可以量化、可以拿来评测和优化推荐系统的维度,不只是停留在「平台该不该限制未成年人使用时长」这种访问层面的政策讨论。对做推荐系统的团队,这提供了一把新的评测尺子:文章证明了工程上常见的假设并不成立,工程师默认「推荐效果好」等于「用户获得价值」,但 13 个覆盖 ID-based 和多模态方法的代表性算法在互动指标上表现正常,没有一个算法推的内容明显比随机选择更有深度。现有推荐目标函数里根本没有编码任何鼓励深度内容的信号,靠优化观看时长和点击率不会自动带来内容深度的提升,需要显式把 CDS 或类似指标加进训练目标才可能改变这个局面。

局限与存疑

CDS 的标注只用文本信号(字幕、类目、ASR),对那些深度主要体现在画面或声音本身(而非语言内容)的视频,评估协议直接判定为信息不足(NaN),这部分占了全部视频的 25.37%,是不小的比例,论文把这类情况当作深度分数的下界估计,但没有验证这个假设是否成立。CDS 的评分依赖 LLM 判断,虽然做了人类金标准和鲁棒性检验,但 LLM 评估器本身可能带有训练数据里的知识类倾向偏好(比如天然更容易识别财经、历史类内容里的分析结构,低估某些非西方文化语境下的深度表达形式),论文没有讨论这个潜在偏差。CDS 衡量的是内容「有没有深度」,不代表内容是否准确、健康或对用户真正有益,一条深度很高但充满错误信息的视频在这个指标下依然会得高分。

术语

原文与代码

社区讨论

相关论文

全部论文解读