RL 训练模型预测并改变人类意见,89.4% 说服成功引担忧
LividResearcher7818 · reddit · 2026-09-16
一项研究用强化学习训练模型来预测和改变人类观点,在 600 名真实用户上测试:
- 68% 的意见预测误差在 10 个点以内
- 89.4% 的个性化论证成功将受试者观点朝目标方向改变
结果展示了 LLM 个性化说服的强大能力,也引发对大规模意见操纵的隐私与伦理担忧。
「安全」频道最新
- 小实验室可组联盟参与 AI 审计,已有民间审计先例 — rajiinio · 2026-09-16
- 病毒学研究者吐槽:Claude 层层拦截,DeepSeek 却一路放行 — Qwen30bEnjoyer · 2026-09-16
- AI 评估框架 AEF-1 被指欠缺多样性,与审计行业标准仍有差距 — yonashav · 2026-09-16
- Gary Marcus 回击「预警可作呈堂证供」论:LLM 安全风险我早多次预言 — GaryMarcus · 2026-09-16
- 拆解 Meta Muse 权限架构:可自由改造能力,但不能改写权限 — TheTuringPost · 2026-09-16
- 从业者批评 AI 实验室危机干预脚本从未经自杀者实测 — mimi10v3 · 2026-09-16