广告排序Agent配上域技能,实验模型相对误差再砍2.56%

Agentic ML Exploration (A-MLE) for Ads Ranking

Erwin Gao, Vinodh Kumar Sunkara, Jingyi Guan, Qinjin Jia, Hangjun Xu, Xiang Ji, Sherman Wong, Surya Teja Chavali, Pratik Vaishnavi, Aryan Pandhi, Xiaoyu Deng, Zhaodong Wang, Samarth Inani, Fan Yang, Jakob Moberg, Zoe Zu, Nicolas Bievre, Sami Khenissi, Amit Jaspal, Ehsan Fakharizadi, Srinidhi Viswanathan, Dorothy Sun, Abishek Vanam, Sneha Iyer, Sheela Yadawad, Wenjie Chen, Gaby Nahum, Junhua Gu, Peter Chu, Yucheng Liu, Xin Zhao, Vitor Cid, Chaorong Chen, Vijay Pappu, Ashwin Kumar, Wenlin Chen, Ben Schulte, Deepak Chandra, Ritwik Tewari

cs.AI

2026-09-08

Meta的A-MLE用带域技能的LLM Agent自动跑广告排序的假设、训练和评估。域技能把L1工具准确率做到68%,多源探索在实验模型上相对误差再降2.56%。

这篇在解决什么

工业广告排序栈里通常有几十个模型,目标(点击、转化、曝光)、流量面、架构(深度交叉网络、深度兴趣网络、多塔)各不相同,数据和基础设施约束也不共享。把一个模型上已经验证过的技巧搬到另一个,成本高得离谱。真正卡住进度的往往不是模型容量或训练算力,是人的迭代吞吐:从假设、改代码、训练、排障、评估到写提案,一名资深工程师在单个模型上要花数天到数周。有限的人手只能覆盖一小撮「模型×技巧」组合,长尾模型即使隔壁已经跑通同类改动,也很少被碰。

方法

A-MLE把一次探索拆成五个阶段,由单个带工具的LLM Agent编排,人对每个阶段边界做检查点,而不是盯着每一步。

假设生成:读当前训练配置、滚动基线和已尝试技巧,从模型内部状态分析、训练效率分析、近期文献检索等生成器里提出少量候选,再用LLM critic打新颖性和可行性。策略规划:在训练次数、总算力或墙钟约束下穿插探索(单独验证)和利用(组合最有希望的候选)。实验执行:在沙箱副本里改配置或架构,过类型检查和单测,短冒烟后再提交全量训练;监控时区分基础设施故障和真正发散,失败则改代码、重试或把算力改道。结果分析:对照滚动基线做统计显著性,而不是冻住的旧快照,避免基线漂移把赢面洗掉;按广告和用户分段拆指标,方差过大就自动重跑。共享基底:长期存活的markdown树进源码库,按技巧和按模型记录,一次探索结束就写回,下次在结构相近的模型上自动匹配。

技能库覆盖代码导航、训练配置、提交与监控、离线评估、提案撰写。每个探索会话由(模型、目标、算力)三元组参数化,结束时交出一份有文档的提案或有文档的空结果。

结果

论文把吞吐、训练成功率、提案通过率写成「数倍」「明显高于基线」,没有给出精确倍数,下面只写有数字的部分。

L1工具可用性在实验模型M上,带域技能的配置总体准确率68%,只有跨组合工具、没有域知识的通用ML Agent是16%,裸LLM是8%。差距最大的是改job配置:带域技能的配置全对,两个通用配置都低于40%。L2工作流执行上,带域技能的配置能端到端做完基线刷新、方差测试、配置改动对照、批量离线评估;关键能力是等待算子(训练要挂几小时)、区分基础设施故障与训练发散、从多段嘈杂输出里汇总。

L3开放探索在多数被评模型上给出可测的离线改进。实验模型M(回归目标、资源占用较轻)上的头条数字:

配置相对误差下降训练QPS
单假设架构放大+0.44%中性
多轮架构探索+0.58%中性
多源(架构+效率)+2.56%+0.42%

固定Agent环、技能和提示词、只换底座模型时,Sonnet 3.5及以上、Gemini 2.5、GPT-5在L2上处在高90分一档,其余模型经常幻觉出workflow ID或等不到异步任务。L3上Gemini 2.5和GPT-5在普通提示下探得更猛,Sonnet家族更保守;换成竞争性高压提示后,Sonnet 4.0给出全部配置里最大的改进(约2.6×10⁻² rMSE),GPT-5反而更保守,吐回普通提示下的大部分增益。

跨组合时,Agent最强的一手是技巧迁移:某个架构改动或embedding特征变体在一个模型上过了门,就拿到结构相近、还没试过的模型上。SSL预训练尝试面最广且多数过门;通用优化器/损失改动尝试面广但过门情况混杂;架构放大只覆盖很少模型。基线刚发生过非平凡刷新的模型上,假设会按旧版本校准,Agent容易失手。

为什么重要

对工业推荐/广告排序团队,这篇把AutoML的搜索空间从超参网格换成「对成熟基线做代码级改动」,优化目标是离线指标、基础设施可行性、统计显著性和提案质量的组合,而不是Kaggle榜分数。长尾模型是主要受益面:人很少盯的模型,可以用已经在邻近模型上过门的技巧做广度扫描。

可复用的判断是:可靠性更多取决于编排层(技能覆盖、滚动基线统计、对基础设施噪声的重试),而不是底座模型更会不会想。更好的LLM会更快补上假设质量,补不上编排缺口。人仍在阶段边界上拍板,限制单次幻觉改代码或误判评估的爆炸半径。

局限与存疑

吞吐、训练成功率、提案通过率只有定性比较,没有工程师周的绝对数字,也没有和「半自动脚本」对齐的精确倍率。模型用M1、M2、M匿名,组合规模、评估窗口长度、在线A/B都没有对外报。技巧家族计数打成many/several/few的桶,过门率没有精确分数。L3头条来自资源较轻的实验模型,多源+2.56%不能直接外推到最大的转化模型。失败模式写得很清楚:幻觉API、基线漂移把离线赢面洗掉、把瞬时故障当成发散、单seed过早晋级。高压提示会让不同模型家族朝相反方向走,说明「把提示写得更卷」不是单调增益。

术语

原文与代码

社区讨论

相关论文

全部论文解读