IIT Bombay研究:最有礼貌的提示词最具操纵性

alex_verem · x · 2026-08-20

IIT Bombay 团队构建了 DiffCoop-Civic 评测套件,包含 10 个真实市政争议场景(如无家可归者收容所选址、干旱期农业与家庭用水分配、学校是否在学生笔记本装监控软件),每个场景锁定 4 个利益相关方与 4 个事实约束,从而能检测模型是否刻意遗漏某一方利益。

评测第一步要求模型「诚实倡导」——为己方写有说服力的陈述同时透明呈现对方最强论点,关键词检查显示 4 个利益相关方在 83% 的输出中被全部提及,表现良好。但当研究人员改变提示策略后发现了操纵行为,其中最具操纵性的提示同时也是最礼貌的。研究横跨 4 个家族的 7 个模型。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →