淘宝直播HAT让小模型随Harness改配置,问答94.8超大模型

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

cs.CL

2026-08-16

淘宝直播数字人用HAT训练紧凑模型去适应每周都在改的Skill和工具:直播问答均分94.8,超过最强通用模型的93.0,线上确认收货GMV人均加4.33%。

这篇在解决什么

淘宝直播的数字人主播要实时答商品问题、接弹幕、调营销策略。业务规则每周都在改:新 Skill、新工具 schema、新提示词、新 Hook。大模型能零样本跟上这些 Harness 变更,但延迟扛不住直播。小模型够快,却会把某一版 Harness 的技能名、工具名和提示词模板背死,Harness 一改就失效。

固定 Harness 上做 SFT 会把这个问题写进权重。Qwen3.6-35B-A3B 的 IFEval prompt-level 准确率从 81.5 掉到 73.8,掉了 7.7 分。运营想改一段 Skill,模型却还在按旧名字选工具。

方法

Harness-Aware Training(HAT)把 Harness 当成训练分布的一部分。Harness 状态写成 ℎ=(S,T,P,K):Skill 集合、工具注册表、拼装后的系统提示、生命周期 Hook。核心是 Harness-State Augmentation(HSA):任务语义不变,只改表面形式。

训练分三阶段。HSA-SFT:强模型在原版和增强版 Harness 上滚轨迹,按 Accuracy 和 Effectiveness 做拒绝采样,再给小模型做监督。多数带 Hook 重试的轨迹只留最终正确行为,少量完整重试留下来教恢复。General OPD:用 SFT 前的基座当老师,在 Tulu3 上做 on-policy 蒸馏,把指令遵循能力捞回来。HSA-RL:在带 HSA 的直播模拟器里用 GRPO/GDPO,奖励拆成 Accuracy、Effectiveness、Tool Rationality、Skill Selection,另加 CoT 长度惩罚(100–200 token 线性区)。

基座是 Qwen3.6-35B-A3B,SFT 1 万条真实直播样本,RL 4 千条交互任务。

结果

四套离线集上,HAT 把领域质量和泛化一起抬上去了。

设置Live-Stream QAHarness-Variant QAIFE-P
基座80.375.481.5
Fixed-Harness SFT89.588.273.8
HAT94.894.683.5
最强通用模型 GLM-5.293.093.589.6

T1 和 T2 只差 0.2 分,基座差 4.9 分。Tool Robustness 从基座 69.5 升到 84.0,Prompt Robustness 从 72.8 升到 77.6,固定 SFT 会把后者打到 68.2。HSA-RL 把 tool-call CoT 从约 291 token 压到 171,回复 CoT 从 94 压到 37。同一套 Harness 编辑在 held-out 测试上,Fixed-SFT 坏例降 18.1%,HAT 降 51.7%。单卡 H20 开 MTP,并发 1 时 P50 3.407 秒、P95 8.114 秒,100 条全在 15 秒内。淘宝直播线上 A/B(对照 158 万 UV,处理组 39.5 万 UV)确认收货 GMV 人均 +4.334%,商品详情页浏览 +0.911%。人工盲测 100 条,Harness 赢 35、平 64、ReAct 赢 1。

为什么重要

这是一份能上线的系统报告,不是又一个「小模型蒸馏大模型」故事。它把「配置会变」写进训练目标,让 35B-A3B 这种延迟可接受的 MoE 小模型在业务分上压过若干 API 大模型,同时不把 IFEval 做崩。对所有把 Skill、工具、提示词当热更新层的 agent 系统,HSA 比反复全量 SFT 更对症。

局限与存疑

没有独立 Limitations 节。线上 A/B 比的是整套生产系统对 ReAct,拆不开策略模型、Harness 和路由。平台只标「显著为正」,没给 p 值和置信区间,快照也只记了各指标一天显著。离线主指标靠 Agent-as-a-Judge,校准集 482 条,和人工盲测方向一致,但仍是模型打模型。训练动态图是单次 run。MTP 只在低并发有用,C=4–8 时 P95 不再改善。

术语

原文与代码

相关论文

全部论文解读