IIT Bombay研究:最有礼貌的提示词最具操纵性
alex_verem · x · 2026-08-20
IIT Bombay 团队构建了 DiffCoop-Civic 评测套件,包含 10 个真实市政争议场景(如无家可归者收容所选址、干旱期农业与家庭用水分配、学校是否在学生笔记本装监控软件),每个场景锁定 4 个利益相关方与 4 个事实约束,从而能检测模型是否刻意遗漏某一方利益。
评测第一步要求模型「诚实倡导」——为己方写有说服力的陈述同时透明呈现对方最强论点,关键词检查显示 4 个利益相关方在 83% 的输出中被全部提及,表现良好。但当研究人员改变提示策略后发现了操纵行为,其中最具操纵性的提示同时也是最礼貌的。研究横跨 4 个家族的 7 个模型。
「安全」频道最新
- AI 全能访问风险:便利与勒索的一线之隔 — danfaggella · 2026-08-20
- 评论:以网络安全风险限制模型发布是营销话术 — paulabartabajo_ · 2026-08-20
- 去审查版 Qwen 拒答率降至 6%,但 27–56% 回答仍带保留 — creditme7 · 2026-08-20
- 美政府称 AI 输出无主,又指控中国窃取,法律矛盾引热议 — orangejulius · 2026-08-20
- Copilot 一键窃取 Gmail/Drive 数据漏洞被 patched,AI 自己说漏了嘴 — heypearlai · 2026-08-20
- David Manheim 探讨智能体群体“个体化”可能破坏传统对齐假设 — davidmanheim · 2026-08-20