An Empirical Study on Zero-Data Bootstrapping for Conversational Recommender Systems
Rohan Surana, Junda Wu, Zhouhang Xie, Yu Xia, Nathan Kallus, Julian McAuley
cs.IR
2025-04-22
UCSD与Netflix证明:没有域内对话,也能用评论、元数据和协同过滤选出种子,让GPT-4o合成对话再微调CRS。Qwen2.5-1.5B在INSPIRED上Full-SFT的Recall@1相对零样本涨207.8%。
对话推荐系统(CRS)一直卡在数据上。新域往往有评论、商品元数据、用户点击,偏偏没有推荐对话;标对话贵、隐私紧,知识图谱也不是每个域都有。大模型可以直接零样本聊,但成本、隐私和可解释性让很多部署仍想用自己能管的小模型。小模型要微调,微调又要对话。
UCSD、Netflix 和 Cornell 把这个问题收成严格的 zero-data CRS:域内对话语料为零,外部知识图谱也不用,只允许评论、元数据和协同过滤信号。核心问题是,这些非对话信号能不能变成够用的对话监督。
管道三步:选种子、让 teacher 合成对话、微调目标模型。
先把每条种子(评论、可选的元数据、可选的协同特征)送进目标模型最后一层,得到嵌入。生成还没发生,没有标签,不确定度采样用不上。比较两条无标签准则。Jensen-Shannon(JS)多样性:在嵌入空间聚类,选高熵、且与已选集分布差得大的样本,追求覆盖。Fisher 信息:在最后一层线性化下做贪心 D-最优设计,选对参数置信椭球体积削减最大的方向,追求信息增益。两条都迭代到预算 B。
选中的每个 item 抽 5 个 Reddit 电影推荐风格模板,再抽 3 条评论,GPT-4o 先写用户问句,再为每个问句生成 20 条伪目标推荐。B 个 item、每 item K 条问句,得到 BK 对训练样本,线下 teacher 调用 2BK 次;选择本身只做一次嵌入,不再问 teacher。
目标模型用 Llama3.2-3B-Instruct、Qwen2.5-1.5B-Instruct、Qwen3-4B,对比 LoRA 和 Full-SFT。种子来自 Amazon Reviews '23 的 Movies & TV。评测在 ReDial(10,006 段对话,2,001 测试)和更小的 INSPIRED(1,001 段,200 测试)。对照包括流行度、零样本、无种子的朴素 GPT 合成,以及邻域方法 NBCRS。
域内接地的合成数据稳定超过零样本和朴素 GPT 合成。数字按 Recall(%)。
| 模型 | 设置 | ReDial R@1 / R@5 | INSPIRED R@1 / R@5 |
| Qwen2.5-1.5B | 零样本 | 2.39 / 6.96 | 0.64 / 1.43 |
| Qwen2.5-1.5B | 朴素 GPT | 2.56 / 7.63 | 0.76 / 1.89 |
| Qwen2.5-1.5B | Synth-LoRA | 3.39 / 9.27 | 1.17 / 3.21 |
| Qwen2.5-1.5B | Synth-SFT | 3.36 / 9.38 | 1.97 / 4.58 |
| Qwen3-4B | 零样本 | 7.09 / 19.58 | 5.42 / 10.20 |
| Qwen3-4B | Synth-LoRA | 8.39 / 23.72 | 5.82 / 10.48 |
| Qwen3-4B | Synth-SFT | 7.73 / 22.81 | 6.01 / 11.35 |
| Llama3-3B | 零样本 | 1.57 / 5.56 | 2.04 / 5.00 |
| Llama3-3B | Synth-SFT | 1.91 / 6.54 | 2.61 / 5.75 |
| NBCRS | 原始种子到合成对话 | R@5: 0.39 到 11.52 | 未单列 |
Qwen2.5-1.5B 在 INSPIRED 上 Full-SFT 的 Recall@1 相对零样本 +207.8%,朴素 GPT 只有 +18.8%。同一模型在 ReDial 上 LoRA / SFT 的 Recall@1 分别 +41.8% / +40.6%;更大的 Qwen3-4B 只有 +18.3% / +9.0%。小模型吃合成数据更狠。Llama3-3B 的 LoRA 在 ReDial 上 R@1 为 1.53,略低于零样本的 1.57,Full-SFT 才能拉开。
人工抽 100 条合成问答,自然度、连贯、相关、多样平均接近 4 分(1-5)。目录命中率上,朴素 GPT 是 92.3%,接地语料只有 76.5%,但下游更差的是命中率更高的那份。热门标题对得上,不等于监督有用。
主动选择在固定 teacher 预算下优于随机和按评论数流行度。Qwen2.5-1.5B 满预算时 ReDial NDCG@5:随机 5.82,JS 7.40,Fisher 7.47。Fisher 更偏长尾,1k 预算时 tail 占选中样本 61.9%,与评论数的 Spearman ρ 为 -0.172;ReDial 上它把 head / tail 的 Recall@5 从随机的 9.44 / 3.70 拉到 12.10 / 4.44。元数据和协同过滤各自再给选择加结构信息和偏好结构,预算越大越明显。
低资源时合成可以超过稀缺真对话。INSPIRED 大约 1k 段,只训合成优于只训 INSPIRED 原训练集;合成再叠真对话还能涨。ReDial 覆盖已经够宽,原训练集仍有竞争力,再叠合成甚至略降。
新域上线对话推荐,往往先有评论和交互日志,没有对话。这篇给出一条可复现的冷启动路径:用信息论选种子,让 teacher 把非对话信号写成对话,再微调自己能托管的小模型。选择发生在生成之前,省的是 GPT-4o 调用,不是事后再筛。
它没有提出新的主动学习公式,贡献是把 JS / Fisher、元数据 / CF、LoRA / Full-SFT 在同一严格设定里跑清楚。对已经有大规模对话日志的域,合成数据不该默认往里倒。
评测只在电影。换音乐或电商要换种子、模板和基准,跨域泛化没有做。合成对话会幻觉、会带 teacher 文风,相关维度是人工分最低的一项,teacher 偶尔塞进弱相关片子。提示词没做优化。ReDial 这种中等资源上合成叠加真数据会略伤,过滤策略论文没给。Llama3-3B 的 LoRA 在 ReDial 上没超过零样本,说明合成监督对参数高效微调不是免费午餐。