Generative Experiences for Digital Mental Health Interventions: Evidence from a Randomized Study
Ananya Bhattacharjee, Michael Liut, Matthew Jörke, Diyi Yang, Emma Brunskill
cs.HC, cs.AI
2026-04-09
GUIDE 让模型运行时同时生成干预内容与交互结构,237 人预注册对照中减压与体验均显著优于 LLM 基线(d=0.39 / 0.27)。
数字心理健康(DMH)工具大多在「给什么内容」上做个性化:按你的情绪、偏好、场景挑一段冥想或一段认知重构练习。但内容匹配对了,交互形态却是固定的——永远是那几步填空、那一段纯文本流程。论文指出,问题出在这一层:一个人压力很大时可能没力气打一大段反思,在通勤路上可能只听得进语音。固定形态的干预会在「用户当下能怎么参与」上失配,再好的内容也送不进去。
GUIDE 要做的,是把「怎么体验」也变成运行时生成的东西,而不只是内容。
GUIDE 把一次干预拆成三段流水线,每段都用同一个套路:生成多个候选,按 rubric 打分,留最高分的。
第一段是上下文收集。五个引导问题,从「发生了什么」逐步问到难度、影响、控制感和当前处境,支持文字或语音回答,再汇总成一段用户可编辑的摘要。
第二段选干预内容。基于认知行为疗法(CBT)生成三个候选,既有针对想法的(认知重构),也有针对行动的(行为激活、问题解决),然后用八条 rubric 逐条打分,包括叙事连贯性、步骤是否安全、是否贴合心理学原理、是否可在日常执行,留分最高的那个。
第三段是这篇的关键:拼交互。GUIDE 维护一组 UX 原语(文本输入、选择项、语音消息、带节拍的引导序列、图片、计时器),根据选中的干预把这些原语组合成一整条交互流程,再用七条 rubric 评估,比如干预与界面是否对齐、任务效率、可用性、信息清晰度。
换句话说,modal 本身是被生成出来的:同一个用户,可能在一次会话里被文字引导,在下一次里被语音和计时器带着走。平均一次会话 18.6 分钟,端到端生成延迟约 52 秒。
237 名本科生(平均年龄 20.78 岁;122 人 GUIDE、115 人对照)参加了一项预注册的、组间对照的单次压力管理实验。对照组本身是一个 LLM 认知重构系统:描述情境、用微调模型在 13 种预设「思维陷阱」里排序识别、再写下一个更平衡的替代想法。所以这次对照比的是「生成交互形态」相对「只生成内容」的增量,不是 AI 相对空白。
| 指标 | GUIDE | 对照 | p | Cohen's d |
| 压力下降幅度 | 0.65±0.7 | 0.35±0.8 | .02 | 0.39 |
| 用户体验 | 0.49±0.6 | 0.33±0.6 | .04 | 0.27 |
| 感到被理解 | 3.70±0.9 | 3.43±1.0 | .04 | 0.30 |
| 复用意愿 | 3.26±1.0 | 2.90±1.2 | .03 | 0.33 |
| 享受程度 | 3.44±1.0 | 3.16±1.0 | .04 | 0.28 |
| 感到个性化 | 3.39±1.1 | 3.40±1.1 | .60 | -0.01 |
主指标都过了 0.05,但效应量是小到中(d=0.270.39)。真正有意思的是两个反差。一是交互多样性:GUIDE 在 122 次会话里产出 76 种不同交互序列(归一化熵 0.87,平均序列相似度 0.40,对照固定为 1.00)。二是用户主观感到的个性化两组几乎没差(p=.60)。客观上大相径庭,主观却感知不到,这是论文自己点出的张力。子组分析里,通过 GUIDE 拿到认知重构的那 17 人减压幅度更大(M=0.88±0.60,p=.002,d=0.74),但样本太小只能算线索。回归模型显示,控制了干预前的压力水平后,GUIDE 的优势仍然显著(β=-0.28,p=.006)。
「生成体验」这个思路不限于心理健康。任何一种界面服务不了所有用户当下状态的场景(新人引导、健身教练、在线教育)都能套用:让模型按上下文挑 modal、拼流程,别只丢一段文字出去。对做 Agent 的人来说,这是「模型编排 UI」的一个干净范例,而且工程上是两个熟悉的零件:best-of-N 加 rubric 裁判,加一个小的 UX 原语 DSL。
那个「客观多样、主观无感」的零结果也值得记住:生成的东西再花,用户未必觉得更贴心。个性化得在感知层验证,不能只看分布。
作者自己列了几条:单次会话、学生样本、探索性分析功效不足、多组件设计无法拆出哪个部件起作用、裁判只有两人、个性化感知在不同序列间不稳定。
补几点读下来的疑问。对照组本身是 LLM 系统,所以这里证明的是「生成体验形态」相对「生成内容」的增量,并没有跟循证的 DMH 应用或空白对照比,不知道 GUIDE 是否真能超越现有成熟方案。样本是计算机专业的本科生,数字素养高、压力属于日常应激而非临床障碍,外推到真实患者要打问号。52 秒的生成延迟对实时交互偏长。最后,d=0.39 这种量级靠单次会话的自评撑起来,严格说只能算「一次会话内即时压力下降」,长期临床意义还需要更长的跟踪。