健康纠错该问就问:RO-PnR少约三成轮次仍拿到最高效用

Ask or Answer: A Decision Framework for Multi-Turn Health Misinformation Intervention

Xiaoying Song, Anirban Saha Anik, Jinyu Liu, Qitao Tan, Geng Yuan, Lingzi Hong

EMNLP 2026

cs.AI

2026-08-22

RO-PnR按再问的终局增益是否盖过提问成本决定追问还是终答,三数据集、三个8B上效用最高,平均约3.5轮,比逢问必问少约30%。

这篇在解决什么

对话里纠正健康谣言,不能只靠一条事实正确的反驳。用户差在两件事:听不听得懂(健康素养),以及愿不愿意改主意(信念承诺)。现有做法两头走:看见帖子立刻回,或按固定轮次一路追问。立刻回会错过真实关切;逢问必问会烧掉注意力,上下文已经够了也还在问。

该不该再问一轮,取决于这一问带来的终局纠错质量,能不能盖过提问成本。这个权衡还跟用户类型有关。低素养且愿意改的人,可能只需一记对准的问题;高素养已经把关切说清的人,可能一问都不用;把谣言握得很紧的人,恰恰需要先摸清语境再纠,硬怼会更顶。

方法

RO-PnR(Reward-Optimized Probe-and-Respond)把每一步收成二元动作:Probe(再问一句)或 Respond(给出最终纠错)。策略只看见对话历史,看不见用户档案标签;档案只驱动模拟用户怎么回话。

用户隐状态是 \(3\times 3\) 网格:健康素养 {functional, interactive, critical} × 信念承诺 {strong, hesitant, open}。模拟器用 GPT-4o-mini,强制短回复、不跳出角色。

奖励分两层。Respond 的即时分是当前回复质量 \(R(ht)\),质量是三项均值:Audience Alignment(口吻是否匹配推断出的素养和立场)、Personalized Grounding(证据是否讲得懂)、Tailored Actionability(下一步是否具体且安全)。Probe 的分是问完之后对话结束时的期望质量,再扣掉随已问次数递增的成本 \(c\cdot nt\),默认 \(c=0.01\)。因此只在「再问一轮的长期增益大于累计提问成本」时才问,越往后门槛越高。

训练先在每组帖子×档案里挑质量最高且事实干净的轨迹做 SFT(LoRA \(r=16\), \(\alpha=32\), 4 个 epoch),再用离线 GRPO 在回合级 Probe/Respond 配对上优化(2 个 epoch, \(\beta{\mathrm{KL}}=0.05\))。GRPO 在同一决策组内比相对优势,不必另训 value 网络。

评测用三个约 8B 的模型:Llama-3.1-8B-Instruct、Qwen3-8B、Gemma-4-E4B-it。微调数据来自自建 CounterHealth:Reddit 上 COVID、流感、HIV 相关帖,经标注与过滤落到 769 条。另两个公开集 MisinfoCorrect、PUBHEALTH 只用于评测。适应度裁判是 mistral-large-2512,事实错误率用带网页核验的 GPT-5-mini。

对照包括:单轮直接回、固定问完再答、按用户反馈反应式追问、按置信度门控,以及只有 SFT、没有回合奖励的澄清器。

结果

主指标是扣提问成本后的 Utility。RO-PnR 在几乎每个「数据集 × 模型」格子上都最高,Utility 0.71–0.73,最强基线 SFT 是 0.68–0.72。平均大约 3.5 轮,比逢问必问的 Fixed-Q / Reactive(约 4.9–5.0 轮)少约 30%。单轮直接回最低(0.53–0.64)。靠置信度几乎不问(1.1–2.0 轮),质量掉得最狠,MisinfoCorrect 上 Utility 落到 0.58–0.62。

方法Quality轮次Utility
单轮直接回0.53–0.64不问0.53–0.64
Fixed-Q / Reactive约 0.68–0.73\(\ge 4.9\)0.67–0.72
Confidence0.58–0.741.1–2.00.58–0.74
SFT0.70–0.723.9–4.60.69–0.72
RO-PnR0.72–0.74约 3.50.71–0.73

增益集中在难用户。Functional 素养上 RO-PnR 是 0.65–0.69,SFT 是 0.62–0.67;死磕用户上是 0.65–0.69,对 SFT 的 0.60–0.66、Confidence 的 0.57–0.61。Open 用户大家都会做,差距收窄到 0.76–0.77 对 0.73–0.76。

消融很干净:奖励只看下一句,Utility 从 0.71 掉到 0.60。\(c=0\) 会问到 5.83 轮,质量崩到 0.51;\(c=0.03\)–\(0.05\) 大约 3 轮,接近完整方法。

小规模真人侧:模拟人设准确度均分 3.87(76% 打到 4 或 5),跨轮一致性 4.64。LLM 裁判与人类 Quality 的 Scott's \(\pi=0.55\),73% 完全一致,MAE=0.23。六名真人、50 帖两两偏好里,RO-PnR 对 Fixed-Q 是 79.7% 对 20.3%;唯一反向的是「低素养 + 死磕」那位,觉得 Fixed-Q 更好处理、更不对抗。事实错误率各方法都低,RO-PnR 在 0.06–0.14,适应度提升没有用胡编换。

为什么重要

多轮纠错里经常真正难的是「还问不问」,不是把同一条事实再写漂亮一点。把提问写成带成本的信息价值问题,再用 GRPO 在回合级配对上训,比固定问完或只看置信度更接近真实对话约束。

能试的场景是客服式健康辟谣、需要先摸清误解再给建议的助手。8B 加 LoRA 就能跑,不要求看见用户标签。实验几乎全在模拟用户上,Utility 的裁判也是 LLM,把它当成生产环境已经能替真人纠错会过头,更接近一个决策框架验证。

局限与存疑

论文自己写了三条:用户是 GPT-4o-mini 演的,真人只覆盖人设校验、裁判一致性和 6 人偏好;只优化何时问,不问什么;成本是按轮扣固定 \(c\),不是认知负荷。

另外几处需要自己打折。档案标签对策略隐藏,但对适应度裁判是可见的,这会让「对齐用户」这条分更好打。CounterHealth 从 Reddit 疫苗和新冠帖来,主题偏窄。Gemma 在 PUBHEALTH 上 FER 到 0.14,比部分基线差,效用领先主要来自适应度和轮次,不是更少胡说。6 人偏好里那位死磕用户站 Fixed-Q,聚合 79.7% 盖不住最难的那一格。

术语

原文与代码

相关论文

全部论文解读