PlatformBid: An Auto-Bidding Benchmark from a Unified Advertising Platform's Perspective
Shengtian Yang, Yewen Li, Peng Jiang, Zhiyi Lyu, Bo An, Peng Jiang, Qingpeng Cai, Lei Feng
cs.LG
2026-07-29
快手首个平台视角自动竞价基准 PlatformBid,配套 flow-matching 方法 BidFlow,两设置综合分最优、线上目标成本 +0.68%。
自动竞价(auto-bidding)是计算广告的核心环节:广告主设好预算和单次转化成本(CPA)上限,算法替他们在实时拍卖里出价。过去十多年的研究和基准,从 iPinYou 数据集到近期工作,几乎都站在 DSP 视角,把单个广告主当成一个独立 agent,目标只有「在 CPA 约束下最大化自己的转化」。
但 Meta、TikTok、快手这类大平台早已把 SSP(卖流量)、DSP(替广告主出价)、Ad Exchange(撮合拍卖)三件事长在一个系统里。从平台的角度,算法好不好不能只看广告主转化,还得看全平台总收入和生态健康。一个在 DSP 视角下表现「最优」的算法,一旦所有广告主同时上线,可能互相压价、把平台收入打下来。评测口径和真实部署之间的这条裂缝,一直没人系统地补。
PlatformBid 做两件事:换一套评测口径,再给一个新方法。
评测口径上的改动。 基准建在 AuctionNet 数据集上(48 个广告主、48 万条训练轨迹,有 Dense/Sparse 两种奖励密度),关键区别是从「单广告主离线优化」改成「多广告主在同一拍卖环境里实时互动」。为防广告主合谋压价伤平台收入,加了底价机制;同时引入平台层指标(总转化、预算利用率),和广告主层指标(CPA 达成率、超标率)并列。综合分(Score)是亮点:CPA 低于目标时按原始转化计分,一旦超标,转化要乘 (目标CPA/实际CPA)² 的惩罚项,把「压成本」和「冲转化」放进同一个数字里比。
三种竞争设置:
新方法 BidFlow。 作者观察到这些竞争设置让出价分布变得多峰(multimodal),传统确定性策略拟合不动。BidFlow 用 flow-matching 训一个行为克隆策略去捕捉这种多峰分布,但 flow 模型推理要迭代多步、太慢;于是再蒸成一个 one-step 策略,既保留 flow 的表达能力,又能在单次前向里出价,同时用 critic 的 Q 值引导往高回报方向走。
Dense 数据集三档设置,BidFlow 综合分:
| 设置 | BidFlow | 最强基线 | 备注 |
| 同质竞争 | 348.04 | GAS 314.27 | CPA 比 0.88,超标率最低 |
| 异质竞争(目标组) | 312.69 | DT score 321.96 | 此档 BidFlow 不占优 |
| 促销竞争 | 356.20 | GAS 333.84 | 全广告主口径 |
线上验证更有说服力:BidFlow 在快手生产环境 A/B,相对重度调优过的 DT 方法,曝光 +0.27%、花费 +0.30%、目标成本 +0.68%。在公开的 iPinYou 数据集上复测,BidFlow 三档全第一。
一个反直觉的发现贯穿全表:CPA 方差越低的策略综合分越高。换句话说,出价越「稳」、越像在和对手协作的策略,平台和广告主双赢;激进博弈两头不讨好。
对广告、RL 从业者,这篇的价值有两层。第一层是基准本身:它用 +0.68% 的线上提升验证了离线评测和线上部署之间的 gap 是能弥合的,意味着在这个基准上跑出来的结论大概率能迁移到真实平台,而不是只在论文表里好看。对做拍卖、做多智能体 RL 的人,这是一个能直接上手的多智能体测试床。
第二层是 BidFlow 的技术配方:用 flow-matching 学表达力强的多峰策略,再蒸馏成单步推理。这个 pattern 不只对竞价有用,任何需要生成式策略却又卡在推理速度上的离线 RL 任务都能借鉴。
作者自己列了三条:只评测竞价算法,没碰拍卖机制设计本身;没有显式建模广告主之间的关系(真实平台是百万级广告主,复杂度远超 48 个)。
读下来还有几处要泼冷水。BidFlow 在异质竞争 + Sparse 奖励这一档明显退化(目标组综合分 35.97,落后 DT score 的 43.91),作者归因于稀疏反馈下建模困难,但没给出修法,而这恰恰是真实场景里最常见的情况。48 个广告主、30 分钟更新一次参数的设定,和真实秒级、百万广告主的体量仍隔着一层。线上 +0.68% 的提升是相对一个已被「重度调优」的 DT,绝对值不算大,而且只报了 target cost 这一项的相对涨幅。