Threads 用自然语言直接调推荐流:意图编译成查询计划,放行精度 94.4%

Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation

Rui Wang, Jiazhou Wang, Zheng Wei, Chenglin Lu, Fangcheng Sun, Ivy Sun, Jin Sun, Hui Geng, Lillian Zhang, Chao Yang, Lei Chen, Shahin Sefati, Reem Helou, Joe Zhou, Babak Shakibi, Yiyi Pan, Bi Xue, Hong Yan, Shujian Bu

cs.AI

2026-08-17

Meta 把自然语言偏好编译成可执行检索计划操纵 Threads 信息流,严格放行门经人工校准精度 94.4%,每 20 槽多 1.1 个合格候选。

这篇在解决什么

搜索把意图编码成一次短命的查询,推荐把意图编码成从行为反推的长期偏好,两边各说各话。Meta 在 Threads 上线了 Dear Algo:用户直接用自然语言对算法下指令,「多来点 NBA 新闻」这类请求会持续操纵后续的 feed 推荐,生成的偏好可以在设置里查看和管理。这篇论文讲的就是这个已部署产品的架构与评测,19 位作者全部来自 Meta。设计的核心约束是产品成本不对称:一个不相关条目一旦进入持久的反馈循环,用户会被反复曝光不想看的内容;拒绝一条内容的代价只是覆盖率降一点。整个系统按 precision-first(先保精确)设计。

方法

意图层跑在 Meta 的 SilverTorch 模型化 GPU 推荐服务上,分三步把请求变成可执行计划:

计划编译一次、多次执行:昂贵的意图推理只跑一次,计划持久化后对新内容刷新;负向意图变成抑制子句,复合意图拆成单元计划去重聚合。搜索式请求和推荐式流送共用这份意图-检索契约,检索、排序、阈值、延迟预算仍按模式各走各的。论文对「统一」一词很克制,拆成基础设施、表示、经验因果三层,系统只统一前两层。

结果

研究结果
盲测人工校准(300 对,296 可评)严格 judge 门的 exact-Relevant 精度 94.4% [88.8%, 98.9%]
配对离线研究(72 请求簇,固定 20 槽)完整配置 7.73 个合格候选 vs LLM 派生查询基线 6.61(+1.11 [0.12, 2.12])
候选随机化 reranker 研究(72 小时窗口,1,278 用户)judge 判不相关份额 2.80% vs 4.78%(-1.97 点 [-3.02, -0.94])
观察性使用研究(三 cohort,约 13 万用户)后 7 天 app 使用 +4.15% 到 +8.61%,举报率区间全部含零

四层证据各答各的问题,论文明说不能合成一个显著性结论,这份克制在工业论文里少见。

为什么重要

这是「LLM 直接操纵线上推荐系统」少见的有公开数字的落地案例,可借鉴的有三点:LLM 出意图、受控词表管接地、DSL 管执行的三段式,让开放语言进了生产检索又不牺牲可检查性;compile-once、execute-many 把昂贵的推理摊销到多次内容刷新上,给延迟敏感的推荐留了活路;precision-first 的四层评估框架(校准、离线配对、随机化、行为)可以直接搬到自家产品。

局限与存疑

作者自己列了不少:使用研究是观察性的,自选择、时间趋势、均值回归都可能贡献那 4-8.6%;离线三臂全都用了接地标签与 STQL,分离不出接地本身的贡献;precision-first 端点是看过初步结果后才明确的,不是预注册;reranker 研究只观测被放行的候选,MNAR 边界跨两个方向。生产 prompt 与模型版本不披露,复现无从谈起。还有一点论文没给:严格门在审计样本里只把 176 个人工判 Relevant 的对放进 84 个,精确是拿覆盖率换的,这个代价对用户体验的影响没有度量。

术语

原文与代码

社区讨论

相关论文

全部论文解读