快手 RecHarness:用 Bandit 路由 LLM 智能体自动优化推荐系统
kuaishou · hf · 2026-08-04
快手团队提出 RecHarness,一种基于 Bandit 路由的智能体框架,旨在自动化推荐模型的优化迭代过程。
- 痛点:传统推荐模型优化高度依赖工程师手动调整架构、目标和训练策略;而直接让 LLM 既定方向又写代码,在有限预算下容易导致搜索不稳定。
- 方案:RecHarness 将优化解耦为两步:首先由 Bandit 路由器根据历史验证反馈选择下一个修改方向;随后由 LLM 在该方向内生成具体的优化假设和代码。同时引入了跳变机制以在局部编辑停滞时激活结构性跳变。
- 效果:在 7 天的大规模短视频广告平台在线 A/B 测试中,该方法使 ADVV 提升 2.084%,收入提升 0.534%,曝光提升 0.559%。
所属事件:快手推出 RecHarness 框架自动化优化推荐系统(2 条相关)→
「编程与Agent」频道最新
- AI 生成代码的审查困境:如何评估贡献者的真实意图 — IronCuk · 2026-08-04
- OpenAI研究员暗示Codex将迎重大进化,下一代模型需更强算力 — soumitrashukla9 · 2026-08-04
- MCP 服务器被官方推荐的经验与增长策略探讨 — potozig · 2026-08-04
- Pydantic AI Harness v0.16.0 发布,新增护栏与上下文压缩 — solyarisoftware · 2026-08-04
- 开源Watchtower:LLM编排LangGraph自动化渗透测试并生成报告 — tom_doerr · 2026-08-04
- MulticaAI 实测:轻松组建多模型协作的智能体开发团队 — jiayuan_jy · 2026-08-04