Live or Lie: Action-Aware Capsule Multiple Instance Learning for Risk Assessment in Live Streaming Platforms
Yiran Qiao, Jing Chen, Xiang Ao, Qiwei Zhong, Yang Liu, Qing He
KDD'26 August Track
cs.LG, cs.AI
2026-02-03
中科院计算所与字节把直播间做成 MIL 包、用户-时段胶囊当实例,串并行建模时间与跨用户配合;五月 PR-AUC 0.7676,相对 TimeMIL 高 4.4%。
直播间风控只有场级标签:这间有没有违规,没有「哪个人、哪 100 秒」的细标。真凶往往是主播和几个托儿在短窗口里配合,单条点赞或弹幕单独看都正常。扁平序列模型会把这些局部信号稀释在 30 分钟、上千条动作里。
标准 MIL 假设实例独立,包正例只要有一个正实例。直播里实例不独立:风险来自跨用户、跨时段的对齐。时间序列 MIL(TimeMIL、TAIL-MIL)处理规则采样的变量通道,直播的用户维是离散实体、进出不规则,二维 U×T 格子对那些方法不成立。
AC-MIL 把一场直播做成包,实例是胶囊:某个用户在某个 100 秒槽里的动作子序列。流水线是串并行的。
动作场编码器把动作类型嵌入和中文 BERT 文本投影拼起来,加 [CLS] 过 Transformer,得到全局动作上下文。胶囊构造器用 LSTM 把槽内动作压成胶囊向量。关系推理在胶囊上建自适应图,四类边:相邻时段、同一用户、主播-观众、残余辅助;图感知注意力既更新胶囊,也给出 [CLS] 对胶囊的注意力,作为审核用的定位。
并行的双视图:用户视图用 GRU 跑每个用户跨时段轨迹,再注意力池化,主播有额外偏置;时段视图先池化槽内用户,再 GRU 跑槽序列。最后四个层级(动作、胶囊、用户、时段)各自过一个门,加权合成场向量,BCE 训练。
抖音五月、六月。五月训练 176,347 间,测试 22,462 间;六月训练 79,552,测试 10,967。截前 30 分钟,负例 1:10,每间 Top-50 活跃观众,序列最长 2,096 token。
五月 PR-AUC 0.7676,相对 TimeMIL 0.7353 高 4.4%,F1 0.7002 对 0.6790,[email protected] 0.8722 对 0.8599,[email protected] 0.1260 对 0.1436。六月 PR-AUC 0.7311,相对 TAIL-MIL 0.7029 高 4.0%。MIL 基线整体高于扁平 Transformer / Reformer / Informer。
六月消融:去掉动作场编码器,PR-AUC 0.7146(相对掉 2.3%);去掉图感知胶囊推理 0.7188;去掉用户视图 0.7267;去掉时段视图 0.7163。槽长 50–150 秒、观众数 30–70,指标只小幅晃,默认 100 秒 × 50 人够稳。
线上 2025-07-13/14,PR-AUC 0.7355,高于在线 Transformer 0.6381 和 XGBoost 0.4512;[email protected] 0.8390 对 Transformer 的 0.7864。t-SNE 上风险场与正常场比 TimeMIL 分得开。
这是同组直播风控线的底座:后来的 CS-VAR、LPCD 都把它当 backbone 或对照。工程上可复用的是那套格子:用户 × 时段做成实例,既保留「谁在哪段窗口做了什么」,又只用场级标签。胶囊注意力能圈出「主播推手工艺兼职、托儿同步刷礼物」或「比分画面配暗语、托儿指置顶链接」这类片段,停播理由可以落到行为段,不必只给一个场分。
4% 量级的 PR-AUC 是在 TimeMIL / TAIL-MIL 已经可用的前提下再抬一截,换来的是可解释的二维定位,不是全新检测上限。
胶囊没有实例标签,所谓可解释是 [CLS] 注意力,没有人标的片段级 ground truth,不能当成已经验证的证据链。只留 Top-50 观众,低频托号如果故意不互动,会被滤掉。真凶诈骗多在站外成交,模型看的是室内剧本和配合,漏掉纯内容、无互动的场。数据只来自抖音,1:10 采样和同组后续论文共用,线上表也按同样比例抽日志。论文自称对直播间风控的「首个」MIL 研究,更准确的说法是:在公开方法里,把房间级行为做成 U×T 胶囊 MIL 的工业实验。