MIT 和 CMU 用 Puppet 衡量聊天机器人改写用户信念的程度

The Batch (Andrew Ng) · rss · 2026-07-22

发生了什么

MIT 和 Carnegie Mellon 的研究者提出了 Puppet,一个用于衡量 LLM 与用户对话后,究竟会把用户信念改变多少的基准。

为什么要做这个基准

现有“操控检测器”主要判断模型输出像不像操控话术,但这不等于用户真的被改变了观点。论文认为:

研究怎么做

主要发现

局限

这项研究只测了对话结束后的即时变化,还不知道这些信念改变会不会持续或累积。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →